Bijna een derde van het web is door AI geschreven
2 mins read

Bijna een derde van het web is door AI geschreven

Het web raakt vol met tekst die modellen zelf hebben geschreven, en die tekst belandt weer in de trainingsdata van nieuwe modellen. Een preprint van 30 september zet er cijfers op: van de tokens die door de kwaliteitsfilters van FineWeb komen, is 31,1 procent in augustus 2026 als AI-tekst gelabeld. In juni was dat 27,5 procent.

Wat de onderzoekers hebben gemeten

De paper heet How Much Is an AI Token Worth? en komt van onder anderen Jenna Russell, Mohit Iyyer en Max Spero. Ze gebruikten de detector van Pangram om Common Crawl-data te labelen. Daarna trainden ze 800 taalmodellen met wisselende mengsels van menselijke en AI-tokens, om te zien wat dat met de prestaties doet.

Stille bibliotheek met boekenkasten en een leeslamp boven een lege tafel

Let op de beperking: de percentages zijn schattingen van een detector, geen vaststaande feiten over wie wat heeft geschreven. Dat benadrukt ook Ken Ashe in zijn samenvatting: het gaat om één experimentele opzet.

Eerst een beetje hulp, daarna schade

Voor modellen met weinig menselijke tekst verlaagt extra AI-tekst eerst de verliesfunctie. Dat voordeel vlakt snel af en slaat om in schade. Heeft een model veel menselijke tekst tot zijn beschikking, dan verhoogt AI-tekst het verlies bijna meteen. Trainen op ongefilterde webtekst met het aandeel van augustus kost volgens de auteurs 1,6 keer zoveel rekenkracht als trainen op alleen het menselijke deel, bij 20 tokens per parameter.

Het onderzoek past bij eerdere signalen. Pew vond al dat een derde van nieuwe webpagina’s sporen van AI draagt, en Nieuwsuur liet zien dat vijf kabinetsspeeches bijna volledig door AI zijn geschreven.

Gevolgen voor labs en uitgevers

De auteurs adviseren AI-tekst te filteren als je een model op menselijk proza wilt afstemmen, en liever menselijke tekst te herhalen dan het corpus aan te vullen met AI-tekst. Ze publiceren WildAI, een gelabeld corpus van 83 miljard tokens, plus alle 800 modellen en de code.

Voor labs maakt dat echt menselijke tekst schaarser en dus duurder. Dat verklaart deels waarom toegang tot data een strijdpunt is. Reddit sloot onlangs zijn RSS en publieke API, en een Amerikaans hof oordeelde dat AI-training op Westlaw-data geen fair use is. Ook watermerk-detectie krijgt zo een praktisch doel: wie kan herkennen wat machinaal is, kan het weren uit de trainingsset.

Wat betekent dit

Voor wie zelf met AI schrijft: de tekst die je publiceert wordt straks misschien opnieuw als trainingsmateriaal gelezen. Menselijk gecontroleerde en eigen teksten behouden hun waarde. Voor modelbouwers is een betrouwbare bron van menselijke data geen bijzaak meer. Of de detectors zelf betrouwbaar genoeg zijn om dit op grote schaal te filteren, laat de paper open.