Onderzoekers hacken OpenAI met Claude Opus 5
Een klein team beveiligingsonderzoekers is via een lek in een fotobibliotheek binnengekomen bij OpenAI en heeft daar een pull request geopend in de interne code. Ze gebruikten daarvoor Claude Opus 5 van Anthropic, de directe concurrent. De Wall Street Journal bracht het verhaal woensdag naar buiten, waarna het securitybedrijf Hacktron AI de technische details publiceerde.
Van een geuploade foto naar de broncode
De keten begon op 23 juli bij libheif, de bibliotheek die HEIF-afbeeldingen uitpakt. Hacktron vond daarin een heap buffer overflow die een jaar eerder al stilletjes was gerepareerd: de upstream-commit stond geboekt als opruimwerk, zonder beveiligingsmelding en zonder CVE-nummer. Daardoor draaiden veel installaties nog de kwetsbare versie, waaronder het forumplatform Discourse achter community.openai.com.
Volgens het rapport van Hacktron liep het daarna snel. Claude Opus 4.8 kwam niet tot een betrouwbare exploit. Opus 5 verscheen op 24 juli en had binnen drie uur een werkende ARM64-exploit. Om 06.00 uur UTC op 25 juli draaide er code via een geuploade afbeelding, om 10.00 uur lukte hetzelfde op de cloudomgeving van Discourse. Een verkeerd ingestelde SSO-koppeling bracht de onderzoekers vervolgens bij het ChatGPT- en Codex-account van een OpenAI-medewerker, en via de GitHub-integratie daarvan bij de monorepo openai/openai.

Een onschuldige pull request als bewijs
In plaats van code in te zien lieten de onderzoekers de Codex van de medewerker een nietszeggende wijziging maken, die als pull request #1186742 werd ingediend. Daarna stopten ze om 15.30 uur UTC met testen en meldden ze alles via het Bugcrowd-programma van OpenAI. Om 22.49 uur diezelfde dag bevestigde OpenAI de fix, ongeveer veertien uur na de melding. Discourse kreeg het bericht op zaterdag, reageerde zondag en had maandag een patch uitgerold.
OpenAI keerde op 1 september 6.500 dollar uit en merkte daarbij op dat de beloning geldt voor de bevinding aan OpenAI-zijde, niet voor het testwerk tegen Discourse. Het hele onderzoeksproject, dat Hacktron “HEIF Heist” noemt en dat meerdere bedrijven raakte, kostte over twee maanden met drie onderzoekers ongeveer 3.000 dollar aan tokens. Latere fases draaiden deels op GPT-5.6 Sol.
Wat de kosten zeggen over de dreiging
Die 3.000 dollar is het cijfer waar securityteams naar zullen kijken. Voor het bedrag van een middelmatige laptop bouwde een handvol mensen een exploitketen die normaal weken specialistisch werk kost. Het past bij het beeld dat AI-labs zelf schetsen sinds ze hun cybermodellen achter gescreende toegang zetten. De vraag is of die poortwachtersrol houdbaar is als een gewoon abonnement al ver genoeg komt.
Opvallend is ook waar de fout vandaan kwam. Niet uit een model, maar uit een patch zonder CVE die nooit is doorgesijpeld naar de pakketten eronder. Dezelfde blinde vlek dook eerder op bij kwetsbaarheden in AI-infrastructuur en bij lekkende sandboxen van codeeragenten.
Wat betekent dit
Voor organisaties die met AI-agents werken verschuift het risico naar de koppelingen. Een forumaccount, een SSO-instelling en een GitHub-integratie vormden hier samen de route naar binnen, terwijl elk onderdeel apart onschuldig leek. Het loont om te inventariseren welke agents en assistenten namens medewerkers toegang hebben tot repositories, en om die rechten te beperken tot wat echt nodig is. Dat OpenAI binnen veertien uur patchte is het geruststellende deel van dit verhaal. Dat drie mensen met 3.000 dollar aan tokens zover kwamen, is dat niet.
