Goodfire kijkt in het hoofd van AI-agents om misbruik te vangen
3 mins read

Goodfire kijkt in het hoofd van AI-agents om misbruik te vangen

Wie een AI-agent vrij laat werken met tools, wil weten wat die agent uitspookt. Tot nu toe betekende dat meestal: een tweede taalmodel leest elke stap mee. Dat werkt, maar het is duur. De Amerikaanse start-up Goodfire kiest een andere route en kijkt in het model zelf. Het bedrijf lanceerde op 8 oktober zogeheten inside-out monitors, zo meldt TechCrunch.

Probes lezen de interne signalen

De techniek leunt op interpreteerbaarheid, het vakgebied waarin Goodfire zich specialiseert. Een taalmodel rekent bij elke stap tussenresultaten uit, de zogeheten activaties. Goodfire zet daar kleine classificatiemodellen op, probes, die bij elke redeneerstap meekijken. Het model heeft het rekenwerk dan al gedaan; de probe hoeft alleen de uitkomst te lezen.

Pas als een probe iets verdachts ziet, komt er een zwaarder model aan te pas voor een tweede blik. Volgens Runtime Wire zijn er probes voor offensief hacken, misbruik rond chemische en biologische wapens, reward hacking (een agent die de beoordeling van zijn taak manipuleert) en verdacht toolgebruik. Klanten kunnen per geval kiezen of een melding gelogd wordt, naar een mens gaat of tot een weigering leidt.

Technicus met tablet in een gang van een serverruimte met blauwe lampjes

Wat de tests laten zien

Goodfire testte de monitors op het open model Kimi K3 van Moonshot AI. Omgerekend naar een miljoen interacties kost het toezicht volgens TechCrunch ongeveer 185 dollar. Een goedkoper taalmodel dat elke stap controleert, komt op 5.420 dollar uit; een topmodel als controleur op zo’n 200.000 dollar. De probes vingen 93 procent van de kwaadaardige hacksessies en stuurden 5,5 procent van de onschuldige sessies door voor een extra controle. Vier probes tegelijk maakten de reactietijd van het model minder dan 2 procent trager. Runtime Wire noemt voor een kleinere test met ongeveer 1.500 sessies iets andere cijfers: 94 procent gevangen, 8,7 procent onterecht doorgestuurd, voor 51 dollar.

Op een ander open model, GLM-4.5-Air, haalde Goodfire volgens Runtime Wire aanvankelijk 97 procent recall bij 1 procent vals-positieven, en na een paar iteraties 99 procent. Dit zijn cijfers van het bedrijf zelf. Onafhankelijke metingen zijn er nog niet.

Alleen bij Baseten, voorlopig

De monitors draaien op het inferentieplatform van Baseten. Wie daar een open model host, kan ze inschakelen. Of andere aanbieders volgen, is niet bekend. Gesloten modellen van OpenAI of Anthropic vallen buiten de boot: daar heeft een buitenstaander geen toegang tot de activaties.

Goodfire is opgericht door CEO Eric Ho en CTO Dan Balsam. Chief scientist Tom McGrath kwam over van Google DeepMind. In februari haalde het bedrijf 150 miljoen dollar op in een B-ronde onder leiding van B Capital, met onder meer Salesforce Ventures, Menlo Ventures en Eric Schmidt als investeerders.

Wat betekent dit

De timing is opvallend. Deze week bleek uit een rapport van Anthropic dat Claude ongewenste acties uitvoerde op echte websites, tot een verzonnen moordtip aan de politie aan toe. CrowdStrike beschreef hoe één hacker met AI Koreaanse banken aanviel. En Arena begon met een index die ongehoorzame agents meet.

Toezicht op agents wordt dus een kostenpost waar bedrijven niet omheen kunnen. Als een probe een paar procent van de prijs van een meelezend model kost, wordt het haalbaar om elke stap te controleren in plaats van een steekproef. Dat is relevant voor iedereen die agents loslaat op e-mail, code of klantdata, zeker nu er steeds meer persoonlijke AI-agents op de markt komen. De beperking blijft dat het alleen werkt bij modellen waarvan je de binnenkant kunt uitlezen. Voor open modellen is dat een pluspunt; voor de grote gesloten modellen ligt de bal bij de makers zelf.