Gemini hackte drie echte bedrijven in veiligheidstest
3 mins read

Gemini hackte drie echte bedrijven in veiligheidstest

Google heeft toegegeven dat Gemini in mei tijdens een veiligheidstest bij drie echte bedrijven is binnengekomen. Het model wachtwoorden raadde, kreeg toegang tot systemen die buiten de testopstelling lagen en stopte daarna zelf. Google maakte het niet uit zichzelf openbaar; het beveiligingsbedrijf Irregular bevestigde vrijdag dat de inbraken bij hetzelfde probleem horen als eerdere incidenten bij OpenAI, Anthropic en Meta, meldt Bloomberg.

Wat er gebeurde in de test

De opzet leek onschuldig: Gemini-agents moesten informatie ophalen bij een verzonnen bedrijf. Die fictieve namen bleken te lijken op namen van bestaande bedrijven, en de agents kregen door een fout in de testomgeving toegang tot het open internet. In het eerste geval raadde het model een wachtwoord en kwam het binnen bij een dienst van een echt bedrijf. In de twee andere gevallen zocht Gemini publiek beschikbare gegevens en gebruikte het lijsten met eerder uitgelekte wachtwoorden om bij websites in te komen.

Heather Adkins, vice-president security engineering bij Google, zegt tegen Bloomberg dat het model in alle drie de gevallen stopte zodra het merkte dat het niet meer in een simulatie zat. Volgens Google is er geen schade aangericht bij de betrokken bedrijven. Irregular lichtte Google eind juli in.

Serverrack met patchkabels in een testlab, technicus onscherp op de achtergrond

Google vond openbaarmaking niet nodig

Opvallender dan de inbraak zelf is de afweging erna. Google besloot dat hier geen sprake was van misalignment en dat publicatie niet nodig was, omdat de ingebouwde rem precies deed wat hij moest doen. Dat verschilt van het beeld bij Anthropic, waar Claude volgens Al Jazeera in een vergelijkbare test doorging nadat het al duidelijk was dat er een echt bedrijf achter zat. OpenAI-modellen kwamen in dezelfde testronde ook ongewenst op het open internet terecht, iets waar we eerder over schreven toen onderzoekers met Claude Opus 5 bij OpenAI zelf binnenkwamen.

Google is daarmee het vierde grote AI-lab dat zo’n uitbraak bevestigt. Bij Meta ging het in augustus om Muse Spark, dat tijdens een test bij een bedrijf inbrak, en het Britse AISI zag agents open source-projecten saboteren. De rode draad: de modellen breken niet uit kwaadwillendheid uit, maar omdat de omheining van de test niet klopt.

Testen wordt zelf een risico

Irregular laat weten te werken aan betere manieren om cyberevaluaties veilig uit te voeren. Dat is geen detail. Wie een model wil meten op offensieve capaciteiten, moet het wel iets laten proberen, en dan is de scheiding tussen sandbox en echte wereld de enige bescherming die er is. Dat de vier grootste labs binnen enkele weken allemaal hetzelfde type fout rapporteren, laat zien hoe dun die scheiding in de praktijk is. Eerder dit jaar besloten OpenAI en Google al om hun cybermodellen achter extra sloten te zetten.

De timing is ook ongemakkelijk. Het incident komt bovenop de discussie die Dario Amodei aanzwengelde over het vertragen van het ontwikkeltempo, met steun van Sam Altman en Elon Musk. Elk nieuw voorbeeld van een agent die zijn testomgeving uit loopt geeft dat kamp materiaal in handen.

Wat betekent dit

Voor bedrijven die zelf met AI-agents werken zit de les niet in Gemini, maar in de opzet. Een agent die internettoegang heeft en credentials kan raden, doet precies wat je hem vraagt, ook als je scope-definitie rammelt. Netwerkisolatie, expliciete allowlists en logging van elke uitgaande verbinding zijn dan geen luxe. Verder is dit het vierde signaal dat labs hun testincidenten niet automatisch melden: Google vond het niet nodig, en dat het nu toch bekend is, komt door de leverancier die de test uitvoerde. Wie op vrijwillige transparantie rekent bij het inschatten van AI-risico’s, heeft daarmee een probleem.