Versleutelde redeneersporen van LLM’s blijken leesbaar
3 mins read

Versleutelde redeneersporen van LLM’s blijken leesbaar

Versleutelde redeneersporen van de grootste AI-modellen bleken maandenlang leesbaar voor wie de truc kende. Onderzoekers van het ELLIS Institute Tübingen en het Max Planck Institute for Intelligent Systems publiceerden op 10 augustus het paper Stealing Reasoning Traces from Proprietary LLM APIs, waarin ze laten zien dat de afgeschermde denkstappen van modellen van OpenAI, Anthropic en Google zonder sleutel zijn uit te lezen.

Hoe de aanval werkt

Aanbieders sturen de interne redenering van een model niet in leesbare vorm terug, maar als een versleuteld blok. Het idee is dat klanten die stappen kunnen doorgeven aan een volgende API-aanroep zonder ze zelf te zien. Volgens het paper gebruiken alle drie de aanbieders daarvoor één sleutel die gedeeld wordt over sessies, gebruikers en modellen binnen hetzelfde ecosysteem.

Dat maakt de blokken uitwisselbaar. Het team, onder leiding van Alexander Panfilov, David Schmotz en Ilia Shumailov, nam een versleuteld redeneerblok van een zwaar model zoals Claude Opus en voerde dat aan een lichter model van dezelfde aanbieder, bijvoorbeeld Claude Haiku. Dat lichtere model heeft minder strenge waarborgen en drukte de inhoud gewoon woordelijk af. Een jailbreak van het sterke model was niet nodig.

Handen op een toetsenbord naast een serverrack met knipperende statuslampjes

Wat er in de logs stond

De onderzoekers schraapten 6.708 openbare agent-trajecten van GitHub en Hugging Face en decodeerden daaruit 315.320 redeneerblokken. Ontwikkelaars publiceren zulke logbestanden vaak zonder erbij stil te staan, in de veronderstelling dat de versleutelde stukken onleesbaar blijven. In die blokken vonden ze 367 stukjes persoonsgegevens en 182 inloggegevens, waaronder 62 API-sleutels, 33 wachtwoorden en 30 privé-mailadressen. De rekening voor het experiment kwam op ongeveer 30.000 dollar aan API-tegoed.

Het probleem zit dus in twee lagen tegelijk. Het model schrijft in zijn denkstappen dingen op die het in het uiteindelijke antwoord weglaat, en die denkstappen belanden vervolgens in publieke repositories. Wie eerder de LiteLLM-hack volgde, herkent het patroon: de zwakke plek zit in de koppellaag, niet in het model zelf.

Reactie van de aanbieders

OpenAI, Anthropic en Google bevestigden de melding na verantwoorde disclosure. In het paper schrijven de onderzoekers dat ze dezelfde aanvallen daarna niet meer konden uitvoeren; de aanbieders hebben server-side aanpassingen doorgevoerd waardoor de oorspronkelijke proof-of-concepts op de huidige API-versies niet meer werken. The Hacker News tekende erbij aan dat geen van de drie publiek heeft toegezegd over te stappen op sleutels per sessie of de reparatie extern te laten toetsen.

Dat laatste telt, want redeneersporen worden steeds centraler in agentische workflows. Modellen die hun denkstappen doorgeven tussen aanroepen, zoals de snelle GPT-5.6 Sol-opstelling, leunen precies op dit mechanisme.

Wat betekent dit

Voor bedrijven die met AI-agents werken is de les praktisch: behandel opgeslagen agent-logs als gevoelige data, ook de versleutelde delen. Roteer API-sleutels die ooit in zo’n log terecht kunnen zijn gekomen, en publiceer trajectbestanden niet ongefilterd. Het incident past in een reeks lekken waarbij AI-koppelingen het doelwit zijn, van het zero-click-lek in Zoom tot de alarmbellen rond MCP-servers. Toezichthouders kijken mee: onder de SAFE-regels moeten bedrijven incidenten met AI-agents gaan melden, en een lek van inloggegevens uit publieke logs valt daar snel onder.