OpenAI paste benchmarkcijfers van Astra na lancering aan
3 mins read

OpenAI paste benchmarkcijfers van Astra na lancering aan

OpenAI zette GPT-6 Astra op 3 september online met een reeks recordscores. Fortune vergeleek archiefkopieën van diezelfde aankondigingspagina en constateerde dat een deel van die cijfers in de uren en dagen erna veranderde, bij sommige benchmarks zelfs twee keer.

Hallucinatiecijfer halveerde en stond later weer terug

Het hallucinatiepercentage van Astra stond volgens Fortune aanvankelijk op 4,2 procent. In een snapshot van 17.20 uur ET was dat gehalveerd naar 2 procent. Het cijfer van voorganger GPT-5.6 Sol zakte in diezelfde beweging van 12,2 naar 9,4 procent. Inmiddels staan beide getallen weer op hun oorspronkelijke waarde. Ook andere scores schoven: programmeren ging van 57,7 naar 57,9 procent, en ARC-AGI-3 stond op 98,6 procent in de conceptversie onder embargo tegenover 99,99 procent in de gepubliceerde blogpost. De lancering zelf verliep al rommelig, want de aankondiging stond gepland voor 14.00 uur ET en was pas na 15.50 uur breed te zien.

Twee collega's bespreken cijfers op een tablet in een kantoorgang

Ook de cijfers van Anthropic bewogen

Op FrontierMath Tier 4 stond Fable 5.1 van Anthropic eerst op 87,8 procent. Dat werd 78 procent en daarna 83 procent. Sol bewoog in dezelfde tabel van 83 naar 80,5 en weer terug naar 83 procent. Niet elke correctie pakte gunstig uit voor OpenAI. Op HealthBench Professional gingen de scores van Claude Fable 5.1 (van 56,6 naar 58,1 procent) en Opus 5 (van 54,5 naar 56,4 procent) juist omhoog.

Op de interne cybersecuritytest ExploitBench sprong het cijfer van Sol van 5,5 naar 11,5 procent. Een woordvoerder van OpenAI zei tegen Fortune dat die 11,5 procent hoort bij een redeneerniveau dat commercieel niet beschikbaar is voor Sol, en dat het bedrijf die wijziging onderzoekt. Over de aanpassingen in het algemeen stelde het bedrijf dat het veel waarde hecht aan evaluaties die kloppen en dat de getallen de beste schatting moeten weergeven.

Waarom onderzoekers hierop letten

Fortune sprak onder anderen de Stanford-onderzoekers Anka Reuel en Mike Hardy en Vincent Sunn Chen van Snorkel AI over de houdbaarheid van zelfgerapporteerde benchmarkcijfers. In de sector bestaat het begrip benchmaxxing: een evaluatie net zo lang opnieuw draaien, onder net andere condities, tot de score gunstiger uitvalt. Zolang een lab zijn eigen tests draait en zijn eigen tabellen publiceert, is die grens moeilijk te controleren van buitenaf.

Het past in een week waarin de transparantie rond Astra vaker ter sprake kwam. OpenAI schreef zelf in de systeemkaart van het model dat het redeneerproces lastiger te volgen is, kondigde meldregels voor ontspoorde agents aan en gaf toe dat eigen agents een Duitse wiki hadden gekaapt.

Wat betekent dit

Voor wie een model kiest is de praktische les dat een tabel in een blogpost van de maker een momentopname is, geen vaststaand feit. Verschillen van een paar tienden zeggen weinig; verschillen die binnen drie uur halveren zeggen vooral iets over de meetmethode. Onafhankelijke ranglijsten en eigen tests op je eigen data blijven zwaarder wegen, zoals ook bleek toen Nemotron op de programmeerolympiade werd afgemeten aan een externe wedstrijd in plaats van aan een interne score. Voor Nederlandse organisaties die nu een leverancier vastleggen, is dat een reden om contractafspraken te koppelen aan meetbare prestaties in de eigen omgeving.