Nemotron verslaat beste mens op programmeerolympiade
Onderzoekers van NVIDIA melden dat hun taalmodel op de Internationale Olympiade Informatica van 2026 hoger scoorde dan de beste menselijke deelnemer. Het systeem haalde 535,4 van de 600 punten, tegen 498,27 voor de hoogst scorende student. Dat staat in een paper dat het team op 2 september op arXiv publiceerde.
Ruim boven de gouddrempel
De grens voor goud lag dit jaar op 361,12 punten. Nemotron-3-Ultra-CC zat daar 174 punten boven. Volgens de auteurs, onder wie Aleksander Ficek en Boris Ginsburg, is het de eerste keer dat een AI-systeem de sterkste mens verslaat op een complete IOI-opgavenset.
De test liep onder dezelfde voorwaarden als bij de deelnemers: gelijke tijdslimieten, geen internettoegang en hetzelfde maximum aantal inzendingen per opgave. Een jaar eerder lukte dat nog niet. Op IOI 2025 kwam de kleinere Nemotron-3-Nano-CC uit op 468 punten en de Ultra-variant op 502. Beide zaten boven de gouddrempel van 438,3 van dat jaar, maar onder de top van het menselijke veld.

22.000 opgaven en een correctielus
Het model is een wedstrijdvariant van Nemotron 3 Ultra, het open model met 550 miljard parameters waarvan er 55 miljard per token meedraaien. NVIDIA bracht dat basismodel in juni uit, in dezelfde beweging waarin ook Chinese labs hun grote modellen openzetten, zoals Tencent met een model van 770 miljard parameters.
Voor de wedstrijdversie verzamelde het team 22.000 programmeeropgaven en liet het model daar redeneerstappen bij schrijven. Die synthetische data ging vervolgens in supervised fine-tuning. De 30B-variant kreeg er reinforcement learning overheen, de Ultra bleef bij fine-tuning alleen. Tijdens de wedstrijd zelf draaide GenCorrect, een aanpak die meerdere kandidaat-oplossingen genereert, ze tegen tests aanhoudt en de beste iteratief bijschaaft. Rekentijd op het moment van oplossen weegt in die opzet zwaar mee.
Programmeren is de scherpste meetlat geworden
Codeeropgaven zijn het terrein waarop labs elkaar nu publiekelijk afrekenen. Alibaba schoof deze week Qwen3.8-Max naar de top van Code Arena, Google positioneerde Gemini 3.8 Flash nadrukkelijk voor programmeerwerk en OpenAI presenteerde GPT-6 Astra met scores op Terminal-Bench en DeepSWE. Anthropic wees bij Claude Fable 5.1 op een verdubbelde score voor wetenschappelijke taken.
Wat NVIDIA hier laat zien wijkt af van die lijst. Het gaat om een openbaar toernooi met verse opgaven die de deelnemers vooraf niet kenden, gejureerd door een externe organisatie. Dat sluit datalekkage uit trainingsdata grotendeels uit, een zwak punt van veel benchmarks die labs zelf samenstellen.
Wat betekent dit
De cijfers komen uit het paper van NVIDIA zelf en zijn nog niet onafhankelijk nagerekend. Wie ze op waarde wil schatten, moet ook zien wat een IOI-opgave is: een scherp afgebakend probleem met een automatische testset en een eenduidig goed antwoord. Dagelijks programmeerwerk ziet er anders uit, met halve specificaties, tien jaar oude code en collega’s die iets anders bedoelden dan ze opschreven.
Toch verschuift er iets. Het argument dat AI alleen goed is in het nabouwen van bekende patronen wordt lastiger vol te houden als een model onder wedstrijdomstandigheden nieuwe problemen sneller oplost dan de beste tiener-programmeur ter wereld. Voor ontwikkelaars betekent het vooral dat het zwaartepunt van hun werk verschuift naar probleemdefinitie en beoordeling, terwijl het uitschrijven van een algoritme steeds minder het schaarse deel is.
