Anthropic leest met J-lens wat Claude bijna zegt
Anthropic heeft een nieuwe kijk in de motorkap van zijn eigen modellen gepresenteerd. De methode heet de Jacobian lens, kortweg J-lens, en laat zien welke woorden een taalmodel op het punt staat te kiezen nog voordat het antwoord op het scherm verschijnt. MIT Technology Review beschreef het als een verborgen ruimte waarin Claude als het ware nadenkt over losse begrippen.
Wat de J-lens precies doet
De techniek pakt een activatie uit een middenlaag van het netwerk en projecteert die via een gemiddelde Jacobiaan naar de uitvoerruimte van het model. Wat overblijft is een geordende lijst van tokens: de woorden waar het model op dat moment naartoe neigt. Zo krijg je niet de ruwe interne wiskunde te zien, maar een leesbare voorspelling van wat er komen gaat. Anthropic publiceerde het werk begin juli en zette een open implementatie op GitHub, met een interactieve demo die via Neuronpedia op open modellen draait.

Een kleine werkruimte in het model
De opvallendste vondst zit in wat Anthropic de J-space noemt. Binnen het enorme aantal berekeningen dat parallel loopt, blijkt een kleine en ijle verzameling interne richtingen te zitten die functioneert als een soort mentale werkruimte. Hier komen de begrippen samen waarover het model kan rapporteren en redeneren. Toen de onderzoekers dit deel uitschakelden, stortte het vermogen om stappen aan elkaar te rijgen in, terwijl de tekst grammaticaal vloeiend bleef. Met andere woorden: het model bleef praten, maar de rode draad in het redeneren viel weg.
Dat sluit aan bij een breder thema in het veld. Waar veel aandacht uitgaat naar prestaties op agentische benchmarks, groeit de vraag hoe die prestaties eigenlijk tot stand komen. Modellen als Claude Opus 5 voeren steeds langere taken zelfstandig uit, en dan wil je weten waar een redenering ontspoort.
Waarom dit voor de veiligheid telt
Interpretatie is geen academische luxe. Als je kunt aflezen welk concept een model activeert, kun je in principe eerder signaleren wanneer het richting ongewenst gedrag beweegt. Dat raakt aan het werk dat andere partijen doen rond AI voor beveiliging, en aan de bredere discussie over toezicht op krachtige modellen. Anthropic, dat onlangs nog met AMD een grote rekencapaciteitsdeal sloot, positioneert interpretatie nadrukkelijk als onderdeel van veilige inzet. Door de code openbaar te maken, kunnen ook externe onderzoekers de methode op open modellen testen en controleren of de claims kloppen.
Er zitten kanttekeningen aan. De J-lens toont wat een model geneigd is te zeggen, niet met zekerheid waarom. En een leesbare projectie blijft een vereenvoudiging van wat er echt gebeurt. Toch is het een van de eerste keren dat een groot lab een concreet, testbaar gereedschap deelt om die interne neiging zichtbaar te maken.
Wat betekent dit
Voor wie met AI werkt, verschuift dit de discussie van alleen uitkomsten naar het proces erachter. Een model dat vloeiend klinkt is niet automatisch een model dat goed redeneert, en met gereedschap als de J-lens wordt dat verschil meetbaar. Voor Anthropic is het ook een strategisch signaal: uitlegbaarheid als verkoopargument, in een markt waar toezichthouders en grote klanten steeds vaker vragen hoe een model tot zijn antwoord komt. De komende maanden zal blijken of andere labs met vergelijkbare, openbare methoden komen of dat ze hun interne keuken liever dicht houden.
