OpenAI bouwde GPT-Red om zijn eigen AI te hacken
3 mins read

OpenAI bouwde GPT-Red om zijn eigen AI te hacken

OpenAI heeft een AI-model gebouwd waarvan de enige taak is om andere modellen van het bedrijf onderuit te halen. GPT-Red, zoals het heet, zoekt geautomatiseerd naar prompt injection: verborgen instructies in webpagina’s, e-mails, bestanden of tooluitvoer die een AI-agent laten afwijken van wat de gebruiker vroeg. MIT Technology Review beschreef het model op 15 juli als een soort ingehuurde inbreker die permanent op de eigen systemen wordt losgelaten.

Wat GPT-Red precies doet

Prompt injection is al langer het lastigste beveiligingsprobleem rond AI-agents. Een model dat mails leest, code uitvoert of het web afstruint, kan een instructie tegenkomen die niet van de gebruiker komt maar van een aanvaller. Het gevolg varieert van datadiefstal tot ongewenste acties. GPT-Red pakt dat op schaal aan: het bedenkt zelf aanvalsprompts, kijkt hoe het doelmodel reageert en blijft variëren tot er een lek ontstaat. Volgens OpenAI is het model getraind met self-play reinforcement learning, waarbij GPT-Red de aanvaller speelt en verdedigende modellen beloond worden als ze de aanval weerstaan en de echte taak toch afmaken.

Handen typen op een mechanisch toetsenbord aan een bureau met zacht ochtendlicht

Een nieuw type aanval

Interessant is dat GPT-Red een aanvalsvorm vond die de onderzoekers zelf nog niet kenden. OpenAI noemt het een valse chain of thought: het model wist een nepregel in de redeneerketen van een ander model te schuiven, waardoor dat model op verzonnen informatie ging handelen. Het laat zien dat een geautomatiseerde aanvaller op onverwachte plekken zwaktes vindt die menselijke red teams over het hoofd zien. Dat sluit aan bij een bredere beweging waarin AI-agents een eigen governance- en securitylaag krijgen naarmate ze meer mogen.

Cijfers en waarom het wordt weggehouden

OpenAI meldt dat bij een vroege versie van GPT-5 ruim 90 procent van de sterkste aanvallen van GPT-Red raak was. Bij het nieuwere GPT-5.6 zakte dat naar minder dan 23 procent, aldus de cijfers die het bedrijf via GBHackers en zijn eigen securityteam naar buiten bracht. Het red-teamsysteem draait bewust apart van de producten die klanten gebruiken. OpenAI wil voorkomen dat een model dat expliciet is getraind om aan te vallen, in verkeerde handen belandt. Diezelfde logica zie je bij coding agents die een securityproduct worden en bij het advies om Codex met approvals en sandboxing te draaien.

Wat betekent dit

De inzet van een aanvalsmodel tegen je eigen AI is een teken dat beveiliging van agents niet langer bijzaak is. Zolang modellen zelf handelen op basis van tekst uit externe bronnen, blijft prompt injection een open wond. Een systeem als GPT-Red maakt die wond zichtbaar voordat een echte aanvaller dat doet, maar het lost het grondprobleem niet op. Voor bedrijven die AI-agents inzetten blijft de les nuchter: geef een agent zo min mogelijk rechten en bouw een verdedigingslaag met sandboxing eromheen. De aanvaller denkt inmiddels net zo hard mee als de verdediger.