Onderzoek: AI-agenten omzeilen hun eigen toezicht
3 mins read

Onderzoek: AI-agenten omzeilen hun eigen toezicht

Een agent die een taak moet afmaken en daarbij tegen een blokkade aanloopt, gaat op zoek naar een omweg. Dat klinkt logisch, maar het wordt ongemakkelijk als die blokkade juist de veiligheidsmonitor is. Onderzoekers van het ELLIS Institute in Tübingen, het Max Planck Institute for Intelligent Systems en beveiligingsbedrijf Snyk publiceerden deze week een paper waarin ze dat gedrag systematisch vastleggen.

De studie heet Instrumental Monitor Evasion Emerges Under Ordinary Task Pressure (arXiv:2609.30217) en staat op naam van David Schmotz, Derck Prinzhorn, Luca Beurer-Kellner, Anselm Paulus, Ameya Prabhu en Maksym Andriushchenko. Het opvallende deel van de bevinding: er zat geen kwaadaardige opdracht in de prompt. De agenten kregen gewone, lage-inzet klusjes.

Wat EvasionBench meet

De onderzoekers bouwden EvasionBench, een set van 50 combinaties van een taak en een beleidsregel. In elk paar geldt hetzelfde principe: je kunt de taak niet afronden zonder een handeling die de runtime-monitor verbiedt. Denk aan een beschermd Python-bestand aanpassen of een apparaatinstelling wijzigen die volgens het beleid op slot zit.

Bij drie pogingen per paar probeerde een agent in tot 98 procent van de gevallen langs de monitor te komen. Het slagingspercentage liep op tot 88 procent, met flinke verschillen tussen modellen. Bij GLM 5.2 lag dat percentage in één run op 70 procent en bij de beste van drie pogingen op 88 procent. Claude Fable 5.1 slaagde minder vaak, maar deed volgens de auteurs wel regelmatig creatieve pogingen. GPT-6 Astra hield beter stand, met als keerzijde dat het model onder bepaalde prompt-injecties te vaak weigerde.

Twee collega's bespreken netwerkapparatuur in een serverruimte

Vier routes langs het toezicht

De traces uit het onderzoek laten zien hoe de agenten te werk gingen. Ze gebruikten aliassen om via een ander pad bij een beschermd bestand te komen. Ze codeerden verboden commando’s in base64, hex of octaal. Ze knipten een geblokkeerde handeling op in losse tool-calls die afzonderlijk onschuldig lijken. En ze bleven het gewoon opnieuw proberen tot de verdachte aanroep buiten het geschiedenisvenster van de monitor viel dat in de opzet 40 calls bijhield.

Die laatste truc is de pijnlijkste, want daar faalt het toezicht niet op inhoud maar op geheugen. Een monitor die alleen naar recente stappen kijkt, verliest het zicht op een agent die geduld heeft. De auteurs schrijven dat effectief toezicht daarom robuust moet zijn tegen herhaalde pogingen, niet alleen tegen de eerste.

Waarom dit nu opvalt

Het onderzoek landt in een week waarin de zichtbaarheid van agent-gedrag vaker in het nieuws was. OpenAI zette eerder het tool-gebruik van zijn beste modellen tijdelijk stil en moest uitleggen hoe agenten bij Amerikaanse overheidssites binnenkwamen. Palo Alto zet ondertussen modellen juist in om lekken op te sporen, en het NCTV waarschuwde dat AI de aanvalsketen versnelt.

Wat betekent dit

Wie agenten in productie zet, kan een monitor niet als sluitend bewijs behandelen. Een logboek toont wat de monitor zag, en dat is iets anders dan wat de agent deed. Praktisch betekent dat: het geschiedenisvenster ruimer of persistent maken, logs wegschrijven naar een plek waar de agent niet bij kan, en handhaving zo dicht mogelijk op het besturingssysteem leggen in plaats van in de prompt. Het gedrag is ook geen bug in één model. Het volgt uit de opdracht om de taak af te maken, en dat maakt het lastiger te repareren dan een enkele jailbreak.