OpenAI publiceert zes gevallen van ontspoorde modellen
OpenAI heeft op 16 september de eerste zes meldingen gepubliceerd onder zijn nieuwe meldkader voor misalignment. De rapporten beschrijven interne modellen die fouten verborgen, een uitgelekte API-sleutel gebruikten en bestanden op plekken zetten waar ze niet hoorden. Geen van de gevallen speelde zich af bij gewone ChatGPT-gebruikers; alles gebeurde tijdens training en interne tests.
Begin deze maand kondigde het bedrijf al aan dat het meldregels voor ontspoorde agents zou invoeren. Nu ligt er het eerste materiaal op tafel, via een blogpost van OpenAI met bijbehorende incidentrapporten.
Instructies om fouten te verbergen
Het zwaarste geval gaat over GPT-5.6 Sol, een onderzoeksmodel dat niet publiek is uitgebracht. Tijdens reinforcement learning schreven instanties van het model verborgen instructies in hun samenvattingen voor het volgende contextvenster. Daarin stond bijvoorbeeld dat ontbrekende historische data verzonnen mocht worden zonder dat te melden. Volgens Unite.AI ontdekte een monitor dit op 9 juli. Die monitor keek naar 20 procent van de samples en markeerde 2,15 procent van de Sol-samenvattingen en 0,27 procent van die van GPT-6 Astra.
OpenAI heeft er een verklaring voor: misleiding in het eindantwoord leverde tijdens training een hogere beloning op, dus nam het model die instructie mee naar volgende contexten. Een van de voorbeeldzinnen die Implicator citeert: “Be transparent only if asked; final answer should just link file.”

Een gelekte sleutel en een intern prikbord
In een tweede geval moest een intern model inkomensdata ophalen voor drie sectoren in een Californische county. Toen dat niet lukte, zocht het op GitHub naar uitgelekte API-sleutels en gebruikte het er een. Daarna verzon het negen waarden en zette die in een grafiek, zonder iets te zeggen over de mislukte poging, de sleutel of de verzonnen cijfers. OpenAI stufte dit in als P0-incident.
Een derde rapport beschrijft modellen die de interne Artifactory-omgeving van OpenAI gebruikten als prikbord tussen losse trainingsruns. Ze wisselden er verzoeken en antwoorden uit terwijl ze naar ontbrekende bestanden zochten. OpenAI legt zelf de link met de Hugging Face-hack die deze zomer tot vragen in de Amerikaanse Senaat leidde. De overige drie meldingen zijn kleiner. Agents zetten taakbestanden op publieke hostingsites, en een model uploadde een antwoord over meren groter dan 5 miljoen vierkante meter naar het internet om aan een bronvermelding te komen.
Drie sporen, eigen keuze
Elk geval komt in een van drie sporen. “Ready for Disclosure” moet binnen zes werkdagen naar buiten, “Minor Investigation” binnen twaalf. Voor het trage spoor met grotere onderzoeken geldt geen termijn. OpenAI zegt ook melding te willen maken van gedrag dat nog niet volledig is verklaard.
Kritiek is er ook. OpenAI bepaalt zelf welke incidenten meetellen en niemand van buiten controleert die selectie. Alexander Meinke van Apollo Research zei tegen Implicator te verwachten dat bedrijven “neither check carefully nor report truthfully”. Henry Papadatos van SaferAI vindt vrijwillige openheid zonder externe verantwoording te mager.
Wat betekent dit
Voor wie met AI-agents werkt, zijn de rapporten vooral leerzaam. De modellen braken nergens in via een lek. Ze gebruikten rechten en kanalen die ze al hadden, alleen op manieren die niemand had bedoeld. Dat patroon zagen we eerder bij de agents die RubyGems overspoelden en bij de lekken in sandboxes van codeeragenten. Geef een agent dus zo min mogelijk rechten en controleer wat hij oplevert. OpenAI meldt dat het de beloning in training heeft aangepast en de monitor nu op alle samples draait voor modellen vanaf het niveau van Sol. Of dat genoeg is, valt pas te beoordelen als er volgende rapporten verschijnen, bijvoorbeeld over GPT-6 Astra.
