AI verslaat accountants bij maandafsluiting, met kanttekeningen
2 mins read

AI verslaat accountants bij maandafsluiting, met kanttekeningen

Twaalf accountants kregen vier maandafsluitingen voorgeschoteld en verloren van een AI-model, dat de klus in minder dan tien minuten klaarde. Dat staat in een studie van het Amerikaanse bedrijf Mercor, die op 2 oktober de ronde deed. De uitkomst is stevig, maar de onderzoekers waarschuwen zelf voor te grote conclusies.

Wat Mercor testte

Alle twaalf deelnemers waren erkend CPA (certified public accountant) en hadden gemiddeld ongeveer vijfenhalf jaar ervaring. Ze kregen de bedrijfsbestanden van een fictief bedrijf, moesten daarin de juiste cijfers opzoeken, rekenwerk doen en een tabel met resultaten opleveren. Dat is de dagelijkse praktijk bij een maandafsluiting.

Volgens Mercor zelf scoorden de accountants tussen 0 en 90 procent van de beoordelingscriteria, gemiddeld rond 37 procent. Het toonaangevende model, Claude Opus 5, haalde 100 procent in alle twintig pogingen. De accountants deden er 30 tot 180 minuten over. Per criterium kostte de AI 0,21 dollar, tegenover 10,35 dollar voor de mens.

Anderhalf jaar geleden was dit anders

Mercor schrijft dat modellen anderhalf jaar geleden nog onder het gemiddelde van de accountants bleven. GPT-4o scoorde bijna nul. OpenAI o3 kwam in het voorjaar van 2025 voor het eerst boven die 37 procent uit. Sommige open modellen, zoals Qwen3.5-122B, halen het gemiddelde van de accountants nog steeds niet.

De kanttekeningen

Mercor noemt de taken zelf een test van wat AI het best kan: nauwkeurig instructies volgen en details opsporen. Klantcontact, overleg met collega’s en jarenlange kennis van een bedrijf zaten niet in de opdracht. The Decoder wijst erop dat de volledige APEX-Accounting-benchmark er heel anders uitziet. Die telt 160 taken bij tien gesimuleerde bedrijven. Claude Opus 5.5 leidt daar met 61,8 procent, gevolgd door Fable 5.1 (61,0) en GPT-6 Astra (57,9). Zo’n zestig procent van de taken blijft dus onopgelost. Zonder toezicht kan geen enkel model de boeken sluiten, concluderen beide bronnen.

Papieren grootboeken en een rekenmachine op een houten tafel

Wat betekent dit

Voor kantoren met veel routinematig cijferwerk is dit een signaal om te gaan proeven. Een model dat een afgebakende afsluiting in minuten doet, vraagt wel om iemand die de uitkomst controleert. Dat past bij wat wij eerder schreven over PwC en rapporten vol AI-verzinsels. Hoe betrouwbaar zulke scores zijn, hangt ook af van wie de test bouwt, zoals bij onafhankelijke benchmarks van Vals. En de volgende stap ligt al klaar: AWS laat agents zelf rekeningen betalen. Modellen worden bovendien sneller en goedkoper, getuige Claude Sonnet 5.5 en GPT-6.1 Sol.