Diffusiemodellen winnen beide topprijzen op ICML 2026
De belangrijkste machine-learningconferentie van het jaar heeft dit keer een duidelijke favoriet. Op ICML 2026, dat van 6 tot 11 juli plaatsvond in het COEX Convention Center in Seoul, gingen beide Outstanding Paper Awards naar onderzoek over diffusiemodellen. Dat blijkt uit de officiële aankondiging op de ICML-blog. Diffusie was lang een techniek voor beeldgeneratie, maar dringt nu door tot de kern van hoe taalmodellen tekst produceren.
Twee prijzen, een gedeeld thema
De eerste bekroonde paper draagt de titel The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models, van een team met onder meer Zanlin Ni en Gao Huang van Tsinghua University. De tweede, High-accuracy sampling for diffusion models and log-concave distributions van Fan Chen en collega’s, gaat over de precisie waarmee je uit een diffusiemodel kunt samplen. Volgens berichtgeving van 36Kr kende de commissie daarnaast een Distinguished Position Paper Award toe aan een kritisch stuk over alignment-gereedschap, en ging de Test of Time Award naar het klassieke A3C-werk over reinforcement learning van DeepMind.

De valkuil van vrijheid
De naam van de Tsinghua-paper verklapt de inhoud. Diffusie-taalmodellen genereren tekst niet woord voor woord van links naar rechts, maar kunnen tokens in willekeurige volgorde invullen en stap voor stap verfijnen. Die vrijheid geldt als een van hun grootste voordelen, samen met snel parallel decoderen. De onderzoekers laten zien dat precies die vrijheid kan tegenwerken. Tijdens training met reinforcement learning grijpt het model de kans om lastige, onzekere tokens over te slaan, terwijl juist die woorden vaak bepalend zijn voor een redenering.
Hun oplossing heet JustGRPO. Het dwingt het model tijdens de RL-fase terug in een gewone volgorde van links naar rechts, als een tijdelijk hulpframe. Bij het daadwerkelijke gebruik behoudt het model zijn tweezijdige aandacht en snelle parallelle uitvoer. Het is een tegendraadse conclusie in een vakgebied dat de willekeurige volgorde juist als kernkwaliteit ziet.
Waarom diffusie in trek is
De aandacht past bij een bredere beweging. Taalmodellen die op diffusie leunen beloven vooral snelheid, doordat ze meerdere woorden tegelijk voorspellen in plaats van een voor een. Google liet dat eerder zien met DiffusionGemma, en NVIDIA bracht met Nemotron TwoTower een variant die tekst ruim twee keer sneller genereert. Snelheid is ook waar de rest van de markt op stuurt, van de nieuwe open modellen zoals Kimi K3 tot GPT-5.6 op Cerebras-hardware.
Dat een academische prijs naar een kritische paper gaat, laat zien dat het veld niet alleen naar records kijkt. Ook fundamenteler begrip van hoe deze modellen vanbinnen werken wint aan gewicht, iets wat je terugziet in recent interpretatiewerk bij Anthropic.
Wat betekent dit
Voor wie AI bouwt of inkoopt is de les nuchter. Diffusie-taalmodellen zijn snel, maar ze zijn niet zomaar een betere versie van de bekende autoregressieve modellen. De prijs voor The Flexibility Trap zegt dat je goed moet nadenken over waar en hoe je die vrijheid inzet. Voor redeneertaken kan een strakke volgorde tijdens training beter uitpakken dan volledige flexibiliteit. Het is een teken dat het onderzoeksveld rond diffusie volwassener wordt, met net zoveel aandacht voor de grenzen als voor de snelheidswinst.
