OpenAI publiceert 722 wiskundepapers van intern model
OpenAI heeft in één keer 722 wiskundige manuscripten op GitHub gezet. Ze komen volgens het bedrijf van een intern model dat nog niet publiek beschikbaar is, en gaan over open problemen uit de getaltheorie, combinatoriek, theoretische informatica en wiskundige fysica. De repository openai/math verscheen in de nacht van 6 op 7 oktober, onder een Apache 2.0-licentie.
Wat staat er in de collectie
De README van de repository spreekt van 722 manuscripten, verdeeld over 372 ‘families’ van verwante resultaten. Het model kreeg tijdens een interne evaluatie ongeveer 4.000 problemen voorgelegd. Per resultaat ging er gemiddeld drie uur rekentijd in, gemeten in de denktijd die ChatGPT Pro gebruikt. OpenAI schrijft dat het deze tests uitbreidde nadat de bestaande wiskunde-evaluaties ‘verzadigd’ raakten: de modellen scoorden daar te hoog om nog iets te meten.
Voor tien resultaten deelt OpenAI ingekorte samenvattingen van de redenering van het model. Daaronder vallen werk aan de Mahler-vermoedens, het vermoeden van Kaplansky over directe eindigheid in karakteristiek twee en de irrationaliteitsexponent van pi. Twee onderdelen vielen buiten de vaste werkwijze: een nulpuntvrij gebied voor de Riemann-zètafunctie en een bewijs van het Hodge-vermoeden voor CM-abelse variëteiten. De uitwerking van dat zèta-resultaat is volgens OpenAI door mensen geredigeerd.

Niet alles is gecontroleerd
OpenAI zet er zelf bij dat ‘sommige van de niet-geformaliseerde resultaten problemen kunnen bevatten’. Een deel van de bewijzen is omgezet naar Lean, een programmeertaal waarmee een computer een bewijs stap voor stap naloopt. Volgens een telling van Tech Insider hebben 235 van de 372 families een link naar een Lean-formalisering en zijn bij 162 papers de hoofdresultaten volledig geformaliseerd. De rest moet nog door menselijke wiskundigen worden beoordeeld.
De publicatie komt een maand na de omstreden claim van OpenAI over Navier-Stokes. Tech Insider herinnert eraan dat Princeton-wiskundige Charles Fefferman toen de belangrijkste inzichten toeschreef aan Diego Córdoba en Luis Martínez-Zoroa, en minder aan het AI-systeem. Eerder lieten ook Fields-medaillewinnaars in een brief weten dat ze zich zorgen maken over AI in hun vak.
Kritiek op de manier van publiceren
Volgens Inside AI News heeft OpenAI overlegd met de onafhankelijke Advisory Group on Mathematics and Artificial Intelligence van het Institute for Advanced Study, onder meer over het herzien en citeren van de papers. Diezelfde groep vroeg AI-labs op 29 september om resultaten in onafhankelijke archieven onder te brengen, de modelnaam te noemen en de prompts te publiceren, meldt Tech Insider. Aan dat laatste voldoet OpenAI nog niet. Het model heeft geen naam gekregen en de prompts staan niet online. In de README staat wel dat het bedrijf opslag bij de wiskundige gemeenschap zelf onderzoekt.
OpenAI is ook niet de enige partij die hier aan werkt. Meta liet vorige week zien hoe Muse Spark wiskundigen hielp bij open problemen, en Claude van Anthropic droeg in september bij aan een record voor elliptische krommen.
Wat betekent dit
Voor wiskundigen verschuift het knelpunt. Een mogelijk bewijs vinden kost dit model gemiddeld drie uur, het controleren kost mensen weken of maanden. Die controle wordt het eigenlijke werk, en Lean-formaliseringen gaan daarin zwaarder wegen. Wetenschappelijke kanalen voelen de druk al: arXiv beperkt onderzoekers sinds kort tot twee papers per maand. Voor iedereen buiten de wiskunde laat de collectie vooral zien wat OpenAI intern al draait. Wanneer dat model in ChatGPT verschijnt, zegt het bedrijf niet.
