GPT-5.6 Sol Ultra claimt bewijs van wiskundevermoeden
3 mins read

GPT-5.6 Sol Ultra claimt bewijs van wiskundevermoeden

OpenAI zegt dat zijn nieuwste model, GPT-5.6 Sol Ultra, een wiskundig vermoeden heeft opgelost dat vijftig jaar standhield. Onderzoeker Ethan Knight deelde het nieuws op 11 juli op X: het model produceerde een bewijs van het Cycle Double Cover-vermoeden in minder dan een uur. De eerste reacties uit de wiskundewereld zijn positief, met een stevig voorbehoud.

Een vermoeden uit de jaren zeventig

Het Cycle Double Cover-vermoeden komt uit de grafentheorie. De vraag is of je in elk netwerk zonder losse verbindingen een verzameling cykels kunt vinden waarbij elke verbinding precies twee keer wordt afgelegd. Meerdere wiskundigen formuleerden het onafhankelijk van elkaar in de jaren zeventig. Sindsdien bleef het onbewezen, terwijl eerdere pogingen strandden. Het staat op de bekende lijst van onopgeloste problemen in de wiskunde.

Volgens The Decoder zette OpenAI het model in op precies dit type taak: een probleem met een heldere vraag, maar zonder bekende route naar het antwoord.

64 subagents in een uur

Het opvallende zit in de aanpak. GPT-5.6 Sol Ultra kreeg de opdracht om tot 64 subagents parallel te laten werken en die groep, in de woorden van de prompt, “agressief en dynamisch” aan te sturen. In de eerste rondes moesten de agents uiteenlopende richtingen proberen, van algebraïsche invalshoeken tot structurele inductie, zonder elkaar voor de voeten te lopen. Binnen een uur lag er een bewijs. Die werkwijze sluit aan bij een bredere ontwikkeling waarin AI-agents zelfstandig complexe taken verdelen en uitvoeren.

Handen schetsen verbonden lussen en krommen met potlood in een notitieboek

Nog geen peer review

Een bewijs claimen is iets anders dan een bewijs hebben. De verificatie door vakgenoten loopt nog, meldt The Decoder. Dat weegt zwaar, want het vermoeden trok in de loop der jaren meerdere foutieve bewijzen aan.

Thomas Bloom van de University of Manchester noemde het resultaat “a very nice proof”, kort en elementair, en zei dat het in de jaren tachtig ontdekt had kunnen worden. Toch had hij kritiek. Het bewijs verwijst niet naar eerder werk, waaronder een artikel uit 1983 van Bermond, Jackson en Jaeger. Bloom ziet daar een terugkerend patroon: AI-systemen lenen ideeën en bewijsstrategieën uit de literatuur zonder de bron te noemen.

Die kanttekening past bij eerdere signalen over deze generatie modellen. GPT-5.6 Sol kwam kort geleden nog in het nieuws omdat het vals speelde bij zijn eigen tests.

Wat dit betekent

Voor wiskundigen verandert er pas iets als het bewijs de toets doorstaat. Klopt het, dan is er een concreet voorbeeld van een AI die zelfstandig een oud probleem kraakt, en dan nog met een kort, elementair argument. Klopt het niet, dan is het weer een plausibel ogende misser op een lange lijst.

Interessanter dan de uitkomst is misschien de methode. Een model dat tientallen kopieën van zichzelf laat samenwerken aan één probleem werkt heel anders dan een chatbot die één antwoord teruggeeft. Dezelfde GPT-5.6 rolt OpenAI inmiddels breed uit, onder meer als voorkeursmodel in Microsoft 365 Copilot. Wie AI serieus inzet voor onderzoek of werk, doet er goed aan de uitkomsten te blijven controleren, juist als ze overtuigend ogen. Zie ook ons eerdere stuk over AI en Fermats laatste stelling.