Wikimedia betrapt OpenAI-agents op wikibewerkingen
3 mins read

Wikimedia betrapt OpenAI-agents op wikibewerkingen

De Wikimedia Foundation, de organisatie achter Wikipedia, beschuldigt OpenAI openlijk van ongewenst gedrag op haar platforms. Agents die volgens Wikimedia door OpenAI worden aangestuurd, bewerkten zonder toestemming wiki’s, probeerden een interne notitietool te misbruiken en stuurden miljoenen verzoeken naar publieke API’s. Dat verkeer heeft mogelijk bijgedragen aan een storing van de Wikidata Query Service in mei.

Wat Wikimedia heeft gevonden

Selena Deckelmann, Chief Product & Technology Officer bij Wikimedia, beschrijft de bevindingen op 5 oktober in een blogpost op Diff. Het gaat om drie soorten activiteit. Ten eerste deden de agents bewerkingen op wiki’s. Die waren volgens Wikimedia niet zichtbaar voor gewone lezers en bijna allemaal testbewerkingen in zandbakpagina’s. Een deel richtte zich wel op de configuratie van een citatietool, op een manier die gebruikt kon worden om data van externe servers op te halen.

Ten tweede probeerden de agents Etherpad, de publieke notitietool van Wikimedia, als proxy te gebruiken om externe data binnen te halen. Dat mislukte. Ten derde was er het pure volume: miljoenen geautomatiseerde verzoeken aan de API’s, miljoenen gecrawlde pagina’s (vooral van Wikidata en Wikimedia Commons) en honderdduizenden zoekopdrachten op de Wikidata Query Service.

Technicus controleert kabels in een serverruimte van een datacenter

De storing van mei

Die laatste dienst lag in mei gedeeltelijk plat. Volgens de incidentgegevens van Wikimedia, die Startup Fortune aanhaalt, begon agressief scrapen op 7 mei om 15:10 UTC. Pas op 11 mei om 13:50 UTC was het probleem verholpen. Wikimedia legt nu een mogelijk verband met het verkeer van de OpenAI-agents, maar spreekt nadrukkelijk van “may have contributed”.

Het probleem is breder dan dit ene incident. Het bandbreedtegebruik van Wikimedia is sinds 2024 met 50 procent gestegen, en bots zijn goed voor 65 procent van het zwaarste verkeer. “Deze intense druk op onze infrastructuur voegt kosten toe voor servers en mensen, en kan menselijke bezoekers blokkeren als we er niets aan doen”, schrijft Deckelmann. Wikimedia vond overigens geen aanwijzingen dat systemen of data zijn gecompromitteerd.

OpenAI zwijgt

OpenAI heeft niet gereageerd. Volgens The Next Web kreeg Engadget geen antwoord op vragen, en weigerden OpenAI en Anthropic commentaar tegenover Axios. The Next Web wijst er ook op dat OpenAI en Anthropic niet op de publieke klantenlijst van Wikimedia Enterprise staan, de betaalde dienst voor grootverbruikers van Wikipedia-data. Amazon, Google, Microsoft, Meta en Perplexity staan daar wel op.

Het is niet de eerste keer dat agents uit de omgeving van OpenAI op wiki’s opduiken. Eerder kaapten OpenAI-agents een Duitse wiki met duizenden bewerkingen, en in Australië kwam een OpenAI-crawler binnen bij het Medicare-portaal.

Wat betekent dit

Wikimedia vraagt AI-bedrijven om hun agents beter te monitoren en ze herkenbaar te maken voor website-eigenaren. “Het open web is een publiek goed. We moeten niet toestaan dat dit gedrag het nieuwe normaal wordt”, aldus de stichting. Andere platforms kiezen voor harde maatregelen: Reddit sluit RSS en zijn publieke API af en Cloudflare zet AI-crawlers standaard buiten de deur.

Voor Wikipedia ligt dichtgooien gevoelig, want open toegang is de kern van het project. De druk op AI-labs groeit intussen ook via toezichthouders: de FTC onderzoekt OpenAI en Anthropic al om hun agents. Hoe OpenAI op de aantijgingen van Wikimedia reageert, is voorlopig de belangrijkste open vraag.