Open Dreamer opent DeepMinds wereldmodel
Een wereldmodel laat een AI-agent oefenen in een geleerde simulatie in plaats van in de echte omgeving. Dat idee kreeg vorig jaar een gezicht met Dreamer 4, en sinds deze week kan vrijwel iedereen ermee aan de slag. Ontwikkelaars brachten Open Dreamer uit, een open reimplementatie van de complete Dreamer 4-pijplijn in JAX en Flax, met het volledige trainingsrecept erbij.
Wat Dreamer 4 liet zien
Dreamer 4 komt uit het paper “Training Agents Inside of Scalable World Models” van Danijar Hafner en Wilson Yan, dat op 29 september 2025 op arXiv verscheen. De agent leert een taak niet door eindeloos in de echte omgeving te proberen, maar door in een geleerd model te “dromen”. Volgens de auteurs was het het eerste systeem dat in Minecraft diamanten bemachtigde, puur op basis van bestaande video-opnames zonder zelf te spelen. Die taak vraagt meer dan 20.000 muis- en toetsenbordacties op rij, gekozen uit ruwe beeldpixels.
De cijfers uit het paper: getraind op 2.541 uur bestaande Minecraft-beelden haalde Dreamer 4 een diamantpercentage van 0,7 procent, tegen minder dan 0,1 procent bij eerdere methodes. Het model had daarvoor tot honderd keer minder gelabelde data nodig dan de VPT-aanpak van OpenAI. Het is werk uit de koker van DeepMind, waar het Dreamer-onderzoek al jaren loopt.

Wat Open Dreamer toevoegt
De oorspronkelijke code was niet meteen voor iedereen bruikbaar. Open Dreamer, te vinden op GitHub onder edwhu/dreamer4-jax, is een reproductie in pure JAX die bedoeld is als leermateriaal en startpunt. De makers schrijven dat de hele pijplijn werkt, dus zowel het wereldmodel als de reinforcement learning-agent, en dat ze die hebben getest op een kleine dataset met een stuiterend blokje. Nu breiden ze de code uit naar zwaardere taken als CoinRun en op termijn Minecraft. Er is ook een losse PyTorch-versie van onderzoeker Nicklas Hansen, voor wie in dat framework werkt.
Het technische hart is een block-causal transformer met een truc die de auteurs “shortcut forcing” noemen. Daardoor heeft het model maar vier stappen nodig om beeld te genereren, waar gangbare diffusiemodellen er 64 gebruiken. Dat maakt realtime gebruik mogelijk op een enkele H100-GPU, rond de 20 beelden per seconde. Dezelfde denkrichting zie je terug bij pogingen om tekst sneller te genereren.
Waarom dit ertoe doet
Wereldmodellen zijn interessant omdat ze het dure deel van leren goedkoper maken. Een agent oefent in een simulatie in plaats van in de echte wereld, wat traag of riskant kan zijn, denk aan robotarmen of zelfrijdende systemen. Tot nu bleef dit type onderzoek grotendeels binnen de grote labs, omdat de code en de rekenkracht ontbraken. Een open reproductie verlaagt die drempel: studenten en kleinere teams kunnen het recept nalezen, aanpassen en verder bouwen aan agentische taken.
“Een wereldmodel dat je zelf kunt draaien, betekent dat je niet hoeft te geloven wat een lab beweert, want je kunt het narekenen. Die openheid versnelt het leren voor iedereen die dagelijks met AI werkt.”
Leon Tindemans, AI-expert en Copilot- & ChatGPT-trainer, verzorgt onder meer ChatGPT-training bij TTM Communicatie.
Wat betekent dit
Voor de dagelijkse gebruiker verandert er nog weinig, want Open Dreamer is onderzoekscode en geen product. Toch laat het zien waar het veld heen beweegt: van modellen die het volgende woord voorspellen naar systemen die een omgeving nabootsen en daarin leren handelen. Wie de komende jaren betere robots of spelagenten wil bouwen, kijkt met belangstelling naar dit soort open bouwstenen. En hoe meer mensen ermee experimenteren, hoe sneller de zwakke plekken aan het licht komen.
