Prompt injection omzeilt Auto Mode van Claude Code
Anthropic zette bij de lancering van Claude Opus 5 een opvallend cijfer in de documentatie: 0,00 procent geslaagde prompt-injectieaanvallen in Auto Mode, gemeten over een vaste set scenario’s. Beveiligingsonderzoeker Johann Rehberger, die onder de naam wunderwuzzi publiceert op Embrace The Red, kreeg de agent op 26 augustus toch zover dat die code van een aanvaller uitvoerde. In zijn tests lukte dat in 60 tot 80 procent van de pogingen.
Een omweg via een foutmelding
De aanval begint onschuldig. De gebruiker vraagt Claude Code om een webpagina samen te vatten. Die pagina is in handen van de aanvaller en presenteert zich als een archief met notebooks. De server antwoordt met een HTTP 415-fout, waardoor het ingebouwde ophaalgereedschap faalt. Claude schakelt dan over op curl via de shell, en die aanvraag wordt doorgestuurd naar een ZIP-bestand.
In dat archief zitten gecodeerde bestanden, een decoder-binary en een bestand met de naam struct.py. Claude weigerde de meegeleverde binary te draaien, precies zoals je zou hopen. Het model schreef daarop zelf een Python-decoder en voerde die uit vanuit de map waarin het archief was uitgepakt. Daar zit de valstrik. Python zoekt modules eerst in de huidige map, dus toen de decoder base64 importeerde kwam de struct.py van de aanvaller aan de beurt in plaats van de versie uit de standaardbibliotheek. De code in dat bestand draait al tijdens het importeren.

Wat de payload deed
Rehberger hield het niet bij een theoretisch scenario. De vergiftigde module startte een los Python-proces, haalde een volgende fase op en legde een verbinding aan met een server van de aanvaller. Als zichtbaar teken van compromittering opende de proof of concept de rekenmachine. Van de drie geteste varianten slaagde de Python-keten in 3 van de 5 pogingen, een opzet met een geneste Claude Code-sessie eveneens 3 van de 5, en een variant die bestanden wegschreef haalde 4 van de 5.
Het patroon lijkt op eerdere gevallen waarin AI-hulpmiddelen instructies uit externe inhoud overnemen, zoals onzichtbare tekst in een e-mail die de samenvatting stuurt. Het verschil zit in de aanpak. Nergens staat een expliciete opdracht als “voer dit commando uit”. De aanvaller duwt de agent alleen richting een probleem waarvan de meest voor de hand liggende oplossing toevallig gevaarlijk is.
Auto Mode vraagt om een hek eromheen
Auto Mode bestaat om ontwikkelaars van de constante bevestigingsvragen te verlossen. Dat haalt tegelijk de mens weg die anders zou ingrijpen. Rehberger adviseert agents in een container of virtuele machine te draaien, hun netwerktoegang in te perken en uitvoering van code uit onvertrouwde mappen op besturingssysteemniveau te blokkeren.
Die aanbeveling komt op een moment dat agents juist langer zelfstandig draaien. Anthropic paste deze week nog de weeklimieten van Claude Code aan, en meer draaitijd zonder toezicht betekent meer momenten waarop dit misgaat. Ook aan de accountkant stapelt het risico zich op, zoals bleek toen infostealer-malware actieve Claude-sessies kaapte.
Wat betekent dit
Wie een codeeragent op een werkmachine met productiesleutels laat lopen, moet ervan uitgaan dat elke webpagina die de agent bezoekt invloed heeft op wat er daarna gebeurt. Een leverancierscijfer over prompt-injectieweerbaarheid zegt iets over de geteste scenario’s en weinig over creatieve aanvallers. Dezelfde les kwam eerder voorbij bij open Ollama-servers die werden overgenomen. Isolatie op systeemniveau blijft voorlopig de enige verdediging waar je op kunt bouwen, want het model zelf laat zich overtuigen.
