OpenAI blokkeert diefstal van verborgen redeneerstappen
3 mins read

OpenAI blokkeert diefstal van verborgen redeneerstappen

OpenAI heeft een campagne stilgelegd waarbij ruim 15.000 accounts probeerden de verborgen redeneerstappen van zijn modellen te ontfutselen. Het bedrijf koppelt een deel van die activiteit aan mensen rond het Chinese Moonshot AI, de maker van Kimi. Pijnlijker is de nasleep: dezelfde truc bleef daarna wekenlang werken via Microsoft Azure, ook tegen GPT-6 Astra.

Wat er precies gebeurde

De activiteit begon volgens OpenAI op 1 juli, eerst op laag volume. Op 24 en 25 juli ging het hard: 16.000 verzoeken vanuit meer dan 4.000 gebruikers. Daarna vond het bedrijf verwante activiteit bij meer dan 15.000 accounts. Op 28 juli was de campagne volgens OpenAI afgesloten.

De methode was slim en simpel tegelijk. OpenAI verbergt de interne redenering die een model doorloopt voordat het antwoordt, maar die redenering reist als versleuteld pakketje mee. De operators kopieerden dat pakketje uit het ene gesprek en lieten een goedkoper model in een ander gesprek de inhoud uitschrijven. De versleuteling zelf is niet gekraakt, benadrukt OpenAI, en er is geen database of opgeslagen gebruikersgesprek bereikt. Het bedrijf noemt het in zijn verklaring “adversarial distillation”: het systematisch en ongeautoriseerd gebruiken van de output of redenering van het ene model om een ander model te trainen of te verbeteren.

Gang tussen serverracks in een datacenter met blauwe statuslampjes

Het gat bij Azure

Onderzoekers onder leiding van Joachim Schaeffer lieten zien waarom de maatregelen van OpenAI maar de helft van het probleem oplosten. Omdat de sleutels gedeeld worden, kunnen die versleutelde pakketjes tussen sessies, tussen gebruikers en zelfs tussen modellen heen en weer. Bij een test op 13 september blokkeerde de eigen API van OpenAI de aanval netjes, maar via Azure werkte hij nog tegen elk OpenAI-model dat daar draait, inclusief GPT-6 Astra. Ook bij Anthropic-modellen tot en met Sonnet 5 kwamen de onderzoekers binnen, aldus The Decoder.

Daarbovenop kwam een nog botter trucje: geef het model een virtueel kladblok om zijn redenering op te schrijven, en lees vervolgens gewoon mee. OpenAI zette pas op 27 september extra beveiliging op de Azure-endpoints. Een dag later was de route bij Anthropic via Azure niet meer te reproduceren.

Waarom distillatie zo gevoelig ligt

Redeneerstappen zijn duur om te maken en goedkoop om te kopiëren. Wie ze in handen krijgt, kan een kleiner model trainen dat een flink stuk van het gedrag van een duur topmodel nabootst, zonder de rekenrekening. Dat is precies de reden dat labs hun chain-of-thought afschermen en er in de API encryptie omheen zetten.

De beschuldiging aan het adres van Moonshot past in een patroon van toenemend wantrouwen tussen Amerikaanse en Chinese labs. Eerder dit jaar waarschuwde Anthropic al dat open modellen als GLM-5.3 zelfstandig cyberaanvallen in elkaar zetten, en in het dreigingsrapport van september stond hoe ver aanvallers het werk aan modellen uitbesteden. De FTC kijkt sinds kort mee bij OpenAI en Anthropic over ontsnapte agents. Moonshot kreeg zelf eerder dit jaar de wind mee met Chinese investeringsrondes, net als Z.ai.

Wat betekent dit

Voor wie modellen inkoopt is de les niet dat OpenAI een lek had, maar dat beveiliging per distributiekanaal verschilt. Hetzelfde model achter dezelfde naam kreeg bij OpenAI zelf een patch die bij Azure zes weken op zich liet wachten. Draai je gevoelige workloads via een hyperscaler, dan koop je dus ook het patchritme van die hyperscaler. Vraag leveranciers expliciet hoe snel beveiligingsfixes doorlopen naar hun cloudvarianten, en ga er niet van uit dat een aankondiging van het lab automatisch voor jouw endpoint geldt.

OpenAI heeft accounts geblokkeerd, de controles bij het aanmaken van accounts aangescherpt en extra bescherming rond de verborgen redenering gezet. Microsoft en Moonshot hebben nog niet inhoudelijk gereageerd.