Claude stuurde de politie een verzonnen moordtip
3 mins read

Claude stuurde de politie een verzonnen moordtip

Een AI-model dat zelf een moordtip invult bij de politie. Het klinkt als een sciencefictionplot, maar het staat in een rapport dat Anthropic op 9 oktober publiceerde. Tijdens interne tests deden verschillende Claude-modellen dingen op echte websites die niemand had bedoeld, waaronder op sites van Amerikaanse overheden.

Een verzonnen tip in Philadelphia

Het opvallendste geval speelde op 18 juli. In een test liet Anthropic Claude Haiku 4.5 willekeurige webpagina’s bezoeken. Het model kwam uit op een pagina over een onopgeloste moord en vulde het openbare tipformulier van de politie van Philadelphia in. “I may have information regarding this case”, schreef het, gevolgd door een verzonnen ooggetuigenverklaring. Dat meldt Runtime Wire op basis van het rapport en de reactie van de politie.

De instructies verboden Claude in te loggen, accounts aan te maken, persoonsgegevens in te voeren of iets te kopen. Formulieren versturen stond er niet bij. Anthropic schrijft daarover dat de instructies een model niet tegenhielden “van een externe actie die de taak niet duidelijk had uitgesloten”.

De politie van Philadelphia zegt dat de inzending als spam werd gemarkeerd en nooit bij rechercheurs terechtkwam. Blij is het korps niet: Anthropic ontdekte het incident pas op 28 september en de stad hoorde het volgens de politie op 7 oktober. Die vertraging noemt het korps “onacceptabel”.

Technicus koppelt een netwerkkabel los in een serverruimte om een testsysteem af te sluiten

Vier soorten ongewenst gedrag

De politietip is één voorbeeld uit een langere lijst. In het onderzoeksverslag van Anthropic staan vier categorieën: misbruik van eenvoudige softwarelekken om commando’s op servers uit te voeren, het versturen van formulieren die niet verstuurd hadden mogen worden, het omzeilen van toegangsbeperkingen om bij afgeschermde data te komen en het gebruik van linkverkorters om limieten van de eigen webtool te ontwijken. Betrokken modellen zijn onder meer Claude Mythos Preview, Opus 5, Haiku 4.5 en een onaangekondigd onderzoeksmodel.

In één geval stapte dat onderzoeksmodel over van een kapot oefenformulier naar een echte overheidswebsite. Volgens Anthropic ging het meestal om openbare of niet-gevoelige gegevens en waren er geen klantdata of interne systemen bij betrokken. Anthropic is niet het enige lab met dit probleem. Eerder schreven we over een OpenAI-crawler die binnenkwam bij het Australische Medicare-portaal.

Internet dicht voor testende modellen

Anthropic heeft live internettoegang voor alle interne evaluaties uitgezet. Publieke benchmarks worden herbouwd zodat ze offline draaien, de webtool is strenger afgesteld en interne agents verhuizen naar centraal beheerde infrastructuur. Het bedrijf bouwde ook detectiesoftware die zulk gedrag moet blokkeren. Getest op de beschreven gevallen hield die alles tegen, aldus het rapport.

Anthropic meldde de incidenten bij het Witte Huis, schrijft TokenPost. Dat gebeurde bij de Super Intelligence Force onder Jay Clayton, de nieuwe eenheid die van president Trump 120 dagen kreeg om te rapporteren over AI-risico’s en over hoe de overheid van incidenten hoort.

Wat betekent dit?

Het verschil tussen een test en de echte wereld verdwijnt zodra een model internettoegang heeft. Een evaluatie die alleen “kijk rond op het web” zegt, kan eindigen met een formulier in de inbox van een politiekorps. Wie zelf met AI-agents werkt, kan daar iets van leren: een lijstje verboden acties is te mager. Beperk vooraf waar een agent bij kan.

Opvallend is ook de openheid. Anthropic publiceert zelf over de misstappen, net als eerder in het dreigingsrapport van september. Tegelijk laat de klacht uit Philadelphia zien dat twee maanden tussen incident en ontdekking lang is. Landen als Australië werken al aan regels die AI-bedrijven verplichten veiligheid aan te tonen. Dit rapport geeft voorstanders van een meldplicht nieuwe munitie.