Verborgen prompt injection blijft zwakke plek van Astra
3 mins read

Verborgen prompt injection blijft zwakke plek van Astra

OpenAI zegt dat GPT-6 Astra vrijwel niet meer te verleiden is met een directe kwaadaardige instructie. De cijfers in de systeemkaart wijzen op een defensiegraad van 99,99 procent tegen directe prompt injection. Het probleem zit ergens anders: bij instructies die verstopt zitten in documenten, webpagina’s of e-mails die het model namens de gebruiker verwerkt. Daar zakt de weerstand hard in.

Gray Swan kraakt Astra in 8,5 procent van de scenario’s

Het onafhankelijke testplatform Gray Swan zette Astra in zijn IPI Arena tegen 1.810 samengestelde aanvallen, met vijftien pogingen per scenario. In 8,5 procent van die scenario’s ging het model minstens één keer overstag. Dat is beter dan voorganger GPT-5.6 Sol, die op 27 procent uitkwam, maar slechter dan Claude Opus 5 van Anthropic met 4,8 procent. The Decoder rekende het om naar een praktischer getal: ongeveer één op de twaalf gevallen gaat mis.

Voor een chatbot die je vragen beantwoordt, is dat een acceptabel risico. Voor een agent die zelfstandig honderden documenten doorloopt, mailboxen leest of een codebase opschoont, ligt dat anders. Elke binnengehaalde pagina is dan een kans voor een aanvaller om er een verborgen opdracht in te stoppen.

Twee collega's overleggen bij een glazen wand over uitgeprinte documenten

Bij volhardende aanvallers zakt de score naar 67 procent

Ook op klassieke jailbreaks is het beeld gemengd. Tegen vaste aanvalsdatasets weigert Astra schadelijke verzoeken in 91,5 tot 98,3 procent van de gevallen. Zodra een aanvaller zijn aanpak over meerdere gespreksrondes bijstelt, valt die weerstand terug naar ongeveer 67 procent. Wie blijft doorduwen, krijgt dus grofweg één op de drie keer alsnog een antwoord dat er niet had mogen zijn.

Dat de theorie snel praktijk wordt, bleek binnen een dag na de lancering. Een onderzoeker meldde een geslaagde jailbreak met een uitgebreide Task-in-Prompt-aanval, een techniek uit een ACL 2025-paper waarbij een schadelijk doel wordt verpakt in een op het oog onschuldige opdracht, aangevuld met vier andere methodes. OpenAI schrijft de sterke score op directe injecties toe aan GPT-Red, een trainingsmethode met geautomatiseerde aanvallers die het model tijdens de training onder vuur nemen. Die aanpak dekt de indirecte route blijkbaar minder goed af.

Waarom het juist nu wringt

OpenAI plaatste Astra onder zijn Preparedness Framework in de categorie Critical voor cybercapaciteiten. Het model scoort 100 procent op ExploitBench, tegenover 78,5 procent voor GPT-5.6 Sol, en kan volgens de systeemkaart privilege-escalatie-exploits schrijven voor geharde besturingssystemen. De uitgerolde versie mag daarom alleen code reviewen en patchen, en weigert proof-of-concept-exploits te maken. Via het programma Daybreak wil OpenAI die grenzen de komende weken verruimen voor verdedigende toepassingen, meldt The Hacker News. Eerder zetten OpenAI en Google hun cybermodellen al achter een slot.

Een model dat beter exploits schrijft en tegelijk gevoelig blijft voor verstopte instructies is een lastige combinatie. Dezelfde week paste OpenAI de benchmarkcijfers van Astra na de lancering aan en meldde het bedrijf dat de redeneerstappen van het model moeilijker te volgen zijn dan bij eerdere generaties.

Wat betekent dit

Wie Astra alleen als chatassistent gebruikt, merkt van dit alles weinig. Zodra je het model documenten, mail of externe websites laat verwerken zonder dat iemand meekijkt, verandert de rekensom. Een foutmarge van één op de twaalf op verborgen injecties betekent dat je de agent niet zomaar rechten geeft op productiesystemen, betalingen of klantdata. Beperk wat de agent mag aanraken, log wat hij doet en zorg dat gevoelige stappen een menselijke bevestiging vragen. De cijfers uit de systeemkaart zijn geen reden om af te haken, wel om het toegangsbeleid opnieuw langs te lopen. Het patroon van de afgelopen weken, waarin frontiermodellen zowel lekken vinden als zelf een risico vormen, maakt dat alleen maar urgenter.