Claude-watermerk faalt juist op code en korte teksten
3 mins read

Claude-watermerk faalt juist op code en korte teksten

Anthropic publiceerde technische details over het onzichtbare watermerk dat sinds begin augustus in teksten van Claude zit. De boodschap is minder geruststellend dan de aankondiging suggereerde: precies daar waar het watermerk het hardst nodig is, in code en in korte feitelijke passages, valt het signaal grotendeels weg.

Hoe het watermerk werkt

Het merk wordt niet achteraf toegevoegd maar tijdens het genereren ingebakken. Anthropic stuurt de tokenkeuze van het model licht bij, zodat er een statistisch patroon in de woordvolgorde ontstaat. Voor een lezer is daar niets van te merken, en volgens Anthropic verandert de betekenis, stijl of leesbaarheid van de tekst niet. Bij bestanden zoals .png, .jpg en .svg gaat het anders: die krijgen ondertekende C2PA-metadata mee, een aanpak die Google en OpenAI al langer inzetten met SynthID en C2PA.

De maatregel geldt voor modellen die op of na 2 augustus 2026 zijn uitgebracht en hoort bij de transparantieverplichtingen uit de EU AI Act, waarvan de transparantieregels sinds deze zomer gelden. Wij schreven eerder over de aankondiging zelf.

Redacteur typt achter een toetsenbord in een rustige redactieruimte

Waar het signaal verdwijnt

De grenzen zijn concreet. Code draagt nauwelijks een merk, omdat de entropie van programmeertaal laag is: er zijn simpelweg te weinig vrije keuzes tussen tokens om een patroon in te verstoppen. Een formatter die de code opschoont, wist de rest. Hetzelfde geldt voor korte fragmenten, die onder de detectiedrempel blijven, en voor feitelijke passages waarin de formulering vastligt.

Verder overleeft het merk kopiëren en plakken, en soms lichte redactie, maar stevig herschrijven, parafraseren of vertalen haalt het eruit. C2PA-metadata is nog fragieler: opnieuw opslaan, converteren of uploaden naar een platform dat afbeeldingen hercodeert, en de herkomstinformatie is weg.

Detectie zonder detectietool

Er is nog een praktisch probleem. Anthropic kondigde een detectie-API aan, maar die was op 15 augustus nog niet beschikbaar en over prijs en toegangsvoorwaarden is niets bekend. Zonder die tool kan een uitgever, docent of redactie het merk niet zelf uitlezen.

Ook als de detectie er wel is, blijft de uitkomst zwakker dan mensen zullen aannemen. Een treffer betekent dat Claude de tekst mogelijk heeft verwerkt, niet dat Claude de auteur is. Wie een zelfgeschreven stuk laat corrigeren of vertalen, krijgt hetzelfde merk mee. Omgekeerd zegt de afwezigheid van een merk niets: oudere modellen, andere aanbieders en een ronde herschrijven leveren allemaal schone tekst op.

“Een watermerk vertelt je hooguit dat een model de tekst heeft aangeraakt, niet wie het bedacht heeft. Organisaties die dit als bewijsmiddel gaan gebruiken, zetten hun eigen mensen klem.”

Leon Tindemans, AI-expert en Copilot- & ChatGPT-trainer. Hij verzorgt onder meer de ChatGPT-training van TTM Communicatie.

Wat betekent dit

Voor bedrijven die AI-gebruik willen aantonen of juist willen uitsluiten, is dit watermerk geen sluitend instrument. Het werkt het best op lange, vrij geschreven prozateksten en het faalt op code, korte antwoorden en alles wat door een tweede bewerkingsronde is gegaan. Dat is nuttig tegen massaal geproduceerde AI-slop, waar platforms als LinkedIn nu ook knoppen voor bouwen, en het is onbruikbaar als bewijs in een individueel geval.

De verstandige lijn voor werkgevers en scholen: leg beleid vast over wanneer AI-gebruik gemeld moet worden, in plaats van te vertrouwen op detectie achteraf. De techniek levert een aanwijzing, geen oordeel. Dat verschil zal de komende maanden nog een paar keer pijnlijk duidelijk worden.