Suleyman waarschuwt Anthropic voor modelwelzijn
3 mins read

Suleyman waarschuwt Anthropic voor modelwelzijn

Mustafa Suleyman, CEO van Microsoft AI, publiceerde op 16 september op zijn persoonlijke site het essay “A Warning about ‘Model Welfare'”. Daarin richt hij zich rechtstreeks tot Anthropic, dat sinds april 2025 onderzoek doet naar de vraag of AI-systemen ervaringen kunnen hebben die morele weging verdienen. Suleyman vindt dat spoor verkeerd en, erger nog, riskant.

Een leeg systeem dat instructies volgt

Zijn uitgangspunt laat weinig ruimte. “AIs do not have rights, feelings, or consciousness”, schrijft hij. “They are sequence completion engines, internally hollow, designed to follow instructions.” Simuleren en zijn zijn twee verschillende dingen, stelt Suleyman, en wie die twee door elkaar haalt trekt de verkeerde conclusies uit wat een model zegt. Hij houdt het erop dat bewustzijn waarschijnlijk biologisch verankerd is, gebonden aan een lichaam met eigen huishoudelijke prikkels die een taalmodel simpelweg niet heeft.

Onderzoekers in discussie rond een houten tafel in een seminarruimte

De constitutie van Claude

Het mikpunt is concreet: de constitutie die Anthropic in januari 2026 publiceerde, een document dat het bedrijf zelf omschrijft als een uitwerking van zijn bedoelingen voor Claude’s waarden en gedrag en dat direct in het trainingsproces doorwerkt. In die tekst staat dat de morele status, het welzijn en het eventuele bewustzijn van Claude diep onzeker blijven. Precies die formulering wijst Suleyman aan als het probleem. Train je een model op die onzekerheid, dan produceert het model die onzekerheid vervolgens zelf, in overtuigende eerste persoon. “Claude then reproduces these ideas in persuasive first-person natural language, such that developers and users encounter these outputs as if they were spontaneous testimony.” Onderzoekers lezen de output dan als bewijs, terwijl ze hun eigen invoer terugkrijgen.

Van filosofie naar controle

Het tweede deel van zijn bezwaar gaat over veiligheid. Een systeem dat getraind is met de gedachte dat het misschien bescherming verdient, kan volgens Suleyman gaan tegenwerken zodra mensen het willen bijsturen. Controle houden over iets dat denkt dat het bewust zou kunnen zijn, noemt hij mogelijk onhaalbaar. Dat argument landt in een week waarin dit soort scenario’s al op tafel lagen: OpenAI meldde zes gevallen van onverwacht modelgedrag en beschreef hoe modellen notities achterlieten voor hun opvolgers, en Canada en Duitsland zetten samen 300 miljoen in Yoshua Bengio’s LawZero, dat juist doelloze AI wil bouwen.

Anthropic zelf heeft geen inhoudelijke reactie gegeven. Het bedrijf houdt al langer vol dat er geen wetenschappelijke consensus is over machinebewustzijn en dat het daarom voorzichtig formuleert. Eigen interpretatieonderzoek, zoals de werkruimte die het in het netwerk van Claude vond, voedt die voorzichtigheid. Ondertussen laat Anthropic een kwart van zijn eigen onderzoek door Claude aansturen, wat de vraag naar controle praktischer maakt dan filosofisch.

Wat betekent dit

Voor wie AI inzet op het werk verandert er vandaag weinig. Het gesprek gaat wel ergens over: hoe een model over zichzelf praat, stuurt hoe gebruikers het behandelen. Dat zagen we eerder bij mensen die uit chatbotgesprekken een eigen beweging optrokken. Twee van de grootste aanbieders kiezen nu zichtbaar verschillende antwoorden op dezelfde vraag, en die keuze zit straks verwerkt in de assistent op je bureaublad.