Anthropic opent watermerk-detectie voor toezichthouders
3 mins read

Anthropic opent watermerk-detectie voor toezichthouders

Anthropic heeft een detectie-API opengesteld waarmee anderen kunnen nagaan of een stuk tekst door Claude is geschreven. De dienst ging op 1 september live, meldt The Decoder, en is niet voor iedereen toegankelijk: alleen partijen die volgens de EU AI Act een controlerende rol hebben, kunnen toegang aanvragen.

Wie toegang krijgt

Op de lijst staan toezichthouders, opsporingsdiensten, mediaorganisaties, factcheckers, onafhankelijke onderzoekers, onderwijsinstellingen en Europese maatschappelijke organisaties. Ook bedrijven die zelf moeten aantonen dat ze aan de transparantieregels voldoen, kunnen zich aanmelden via een formulier. Anthropic noemt het een private preview en zegt de toegang stapsgewijs te verbreden. Een publieke checker waar iedereen een tekst in kan plakken komt er dus voorlopig niet.

Dat is een bewuste keuze. Zodra iedereen kan testen of een tekst het merk draagt, kan iemand ook systematisch uitproberen welke bewerkingen het merk wissen. De rem op toegang houdt die ontsnappingsroute dicht, maar zorgt er ook voor dat de gemiddelde docent of hr-medewerker er niets aan heeft.

Twee journalisten vergelijken documenten op papier en op een monitor

Wat het watermerk precies doet

Anthropic gebruikt een variant op SynthID Text, de methode die Google DeepMind in 2024 in Nature publiceerde. Bij het genereren van tekst stuurt het model de willekeur in de woordkeuze een klein beetje bij, zodat er een statistisch patroon in de zinnen achterblijft. Dat patroon is met de juiste sleutel terug te rekenen. Volgens het bedrijf zit er geen gebruikersdata in het merk en verandert er niets aan de inhoud of de leesbaarheid van de tekst. Alle Claude-modellen die na 2 augustus 2025 zijn uitgebracht, dragen het merk standaard. Dat onzichtbare watermerk in Claude-teksten zat er dus al een jaar in, alleen kon niemand buiten Anthropic het uitlezen.

Anthropic stelt dat het merk lichte bewerking overleeft, iets wat klassieke AI-detectors zoals Pangram niet lukt. Die draaien op gokwerk over schrijfstijl en zitten er regelmatig naast.

Waar het misgaat

De zwakke plekken zijn geen verrassing. Anthropic beschreef in augustus zelf al dat de methode slecht werkt op code en korte teksten. Bij een tweet, een feitelijke opsomming of een stuk Python is er nauwelijks ruimte om tussen gelijkwaardige formuleringen te kiezen, en zonder die ruimte is er geen patroon om in te bakken.

Er is ook kritiek op de claim dat de tekstkwaliteit onaangetast blijft. Als Claude een synoniem kiest omdat de watermerksleutel dat zo uitkomt en niet omdat het woord beter past, betaalt de lezer daar iets voor. Anthropic bestrijdt dat, maar publiceerde geen blinde vergelijking waarmee buitenstaanders dat kunnen narekenen.

Wat betekent dit

Voor Nederlandse redacties, scholen en juridische afdelingen verandert er op korte termijn weinig, simpelweg omdat ze de API niet zomaar krijgen. De betekenis zit in de handhaving: de transparantieplicht uit de AI Act geldt al, en toezichthouders krijgen nu voor het eerst een technisch middel om een claim over herkomst te toetsen in plaats van af te gaan op wat een aanbieder zelf zegt. Tot nu toe leverde die handhaving weinig op: de wet draait inmiddels weken zonder een enkele zaak.

Praktisch blijft de weeffout dat het merk alleen Claude aanwijst. Wie een tekst door een ander model haalt, of hem stevig herschrijft, komt er ongemerkt doorheen. Zolang OpenAI, Google en de Chinese aanbieders hun eigen sleutels niet op vergelijkbare wijze openstellen, is dit een controlemiddel voor precies een leverancier.