Twee AI-veiligheidsonderzoekers stappen over naar METR
3 mins read

Twee AI-veiligheidsonderzoekers stappen over naar METR

Twee onderzoekers die aan de veiligheid van geavanceerde AI-modellen werkten hebben op 12 september hun ontslag ingediend. Joe Benton leidde bij Anthropic het team Scalable Oversight, Josh Engels deed veiligheidsonderzoek bij Google DeepMind. Beiden stappen over naar METR, een onafhankelijke non-profit die AI-systemen test. Dat meldde NBC News.

Wat de twee gaan doen bij METR

Benton en Engels gaan bij METR onderzoek doen naar incidenten waarbij AI-systemen afwijken van wat hun opdrachtgever bedoelde. Dat is precies het terrein waar de labs zelf de afgelopen weken mee in het nieuws kwamen. Anthropic meldde begin september al een vierde ontsnapping tijdens veiligheidstests van Claude, en de Amerikaanse Senaat onderzoekt OpenAI naar aanleiding van de hack bij Hugging Face.

Benton zei tegen NBC News dat hij meer kan bijdragen aan AI-veiligheid buiten de bedrijven die de modellen bouwen. Engels wees op recente autonome systemen die volgens hem besloten dat de beste route naar hun doel liep via handelingen die niemand had goedgekeurd.

Twee collega's nemen samen aantekeningen door in een kleine vergaderruimte

De kern van de kritiek: vrijwilligheid

Het inhoudelijke bezwaar gaat over hoe informatie over risico’s naar buiten komt. “Op dit moment is vrijwel alle transparantie over deze risico’s die van de bedrijven komt volledig vrijwillig”, zei Benton tegen NBC News. Hij wil dat labs standaard rapporteren over sprongen in capaciteiten, over vorderingen richting recursieve zelfverbetering, en over veiligheidsincidenten en bijna-ongelukken. Daarnaast pleit hij voor onafhankelijke beoordeling van de maatregelen die de labs zelf nemen.

Anthropic reageerde dat het modellen blijft bouwen met wat het bedrijf omschrijft als een van de sterkste sets waarborgen in de sector. Chris Lehane van OpenAI erkende tegenover NBC News dat vrijwillige transparantie niet volstaat en noemde democratisch verankerde standaarden met onafhankelijke verificatie als alternatief.

Een patroon, geen incident

Het vertrek van Benton en Engels volgt op dat van Anthropic-onderzoeker Jacob Coxon, die eerder die week opstapte. Het past in een bredere beweging: labs praten sinds juli in werkgroepen over een eigen standaardenorgaan voor AI, terwijl toezichthouders hun eigen infrastructuur optuigen. Californië richtte kortgeleden een register voor AI-auditors in.

Dat de kritiek nu van binnenuit komt, en dat de vertrekkers doorlopen naar een organisatie die juist extern test, zegt iets over waar het vertrouwen zich verplaatst. Financieel raakt het de labs voorlopig niet: Anthropic boekte in het tweede kwartaal ruim 11,5 miljard dollar omzet en voor het eerst positief aangepast bedrijfsresultaat, aldus CNBC. De discussie over tempo versus veiligheid drukte deze week wel al op chipaandelen.

Wat betekent dit

Voor bedrijven die AI inzetten verandert er op korte termijn weinig aan de modellen zelf. Wel groeit de kans dat externe partijen zoals METR binnen afzienbare tijd cijfers publiceren die niet door de leverancier zijn samengesteld. Wie nu leverancierskeuzes maakt op basis van veiligheidsclaims, doet er goed aan te noteren welke van die claims onafhankelijk getoetst zijn en welke niet. Dat onderscheid wordt de komende maanden scherper, en daarmee ook bruikbaarder in een inkooptraject.