Lezers geven AI-verhalen hogere cijfers dan mensenwerk
Wie denkt een door AI geschreven kort verhaal er zo uit te pikken, heeft dat waarschijnlijk mis. Psychologen van Villanova University legden bijna 2.600 volwassenen korte verhalen voor, deels van menselijke auteurs en deels van ChatGPT. De AI-teksten kregen de hoogste cijfers.
Wat de onderzoekers deden
Het onderzoek verscheen deze week in Judgment and Decision Making, het tijdschrift van Cambridge University Press, onder leiding van Deena Weisberg, universitair hoofddocent psychologie in Villanova. In drie experimenten met samen 2.587 deelnemers tussen 18 en 81 jaar lazen proefpersonen een van zes korte verhalen: drie uit literaire publicaties, drie geschreven door ChatGPT. Het eerste experiment telde 1.682 deelnemers, de twee vervolgexperimenten 424 en 481.
De AI-verhalen scoorden hoger op kwaliteit en op de mate waarin lezers erin opgingen. TIME zette de verschillen op ongeveer 6 procent voor kwaliteit en 8 procent voor betrokkenheid. Er zit een wrange draai aan. Kregen deelnemers te horen dat een AI-verhaal van een mens kwam, dan ging het cijfer nog wat verder omhoog.

Herkennen lukt eenvoudigweg niet
De deelnemers moesten ook raden wie de auteur was. In het tweede experiment zat 39,93 procent er goed, dus onder het toevalsniveau. In het derde experiment kwam dat uit op 51,97 procent, statistisch niet te onderscheiden van gokken. Wie meer van AI wist, presteerde beter: elk punt hoger op de gebruikte schaal voor AI-geletterdheid gaf volgens de onderzoekers 14 tot 33 procent meer kans op een juiste inschatting. Een achtergrond in literatuur hielp niet.
Dat laatste zegt iets over hoe deze systemen schrijven. Een taalmodel mikt op de gemiddelde lezer en levert tekst zonder scherpe randjes af. Menselijke auteurs zijn eigenzinnig, en die eigenzinnigheid kost een lezer moeite. Weisberg wijst in TIME op precies dat verschil: AI-tekst leest helderder en directer weg, menselijk werk is subtieler.
Waarom dit voor redacties telt
De uitkomst botst met de aanname dat publiek AI-tekst vanzelf doorheeft. Platforms bouwen inmiddels wel aan filters, zoals de knop waarmee LinkedIn-gebruikers AI-slop kunnen melden, maar dat blijft leunen op mensen die het verschil zien. In de journalistiek gaat het inmiddels om openheid vooraf: eerder deze week bleek dat een recordaantal Pulitzer-winnaars AI-gebruik meldde in de eigen inzending.
Wetgevers kiezen dezelfde route. De Californische transparantiewet SB 942 verplicht aanbieders om AI-materiaal te labelen, omdat achteraf herkennen te onbetrouwbaar is. In de creatieve sector loopt het conflict harder, zie de Duitse uitspraak tegen Suno over AI-muziek.
Wat betekent dit
Voor uitgevers, docenten en redacties verschuift de vraag. Detectie met het blote oog is geen werkbare controle meer, ook niet bij lezers met een literaire opleiding. Wat overblijft, is vastleggen waar tekst vandaan komt op het moment dat die wordt gemaakt: herkomstlabels, redactionele afspraken en duidelijkheid richting het publiek.
Er zit ook een les in voor iedereen die AI inzet bij het schrijven. Modellen leveren gladde, goed leesbare tekst, en juist die gladheid maakt hun werk populair bij lezers. Wie zich wil onderscheiden, zal het van eigen stem moeten hebben, niet van de vraag of iemand de machine er nog uithaalt.
