Shanghai AI Lab zet 744B-agentmodel Atria Dawn open
Het Shanghai Artificial Intelligence Laboratory heeft Atria Dawn Preview vrijgegeven, een agentisch model van 744 miljard parameters dat onder een MIT-licentie te downloaden is. De gewichten stonden op 11 september op Hugging Face, de FP8-versie een dag later. Het bijbehorende arXiv-paper verscheen pas op 15 september. Een persbericht kwam er niet.
Een post-training bovenop GLM-5.2
Atria Dawn is geen model dat vanaf nul is getraind. Het lab bouwde voort op GLM-5.2, het mixture-of-experts-model dat Z.ai in juni uitbracht, en deed daar een eigen post-training overheen. Dat verklaart waarom een onderzoeksinstituut in korte tijd met iets van deze omvang kan komen. Z.ai haalde onlangs vijf miljard op voor de volgende GLM-generatie, en die basis komt nu dus ook bij andere partijen terecht.
De modelkaart noemt 753 miljard parameters in totaal en een contextvenster van 256.000 tokens. Het model is alleen tekst, downloadbaar in BF16 en FP8, en er is een OpenAI-compatibele API op api.atria-asi.ai. De MIT-licentie is het opvallendste deel: wie genoeg GPU’s heeft, mag het model commercieel draaien zonder onderhandeling vooraf. Dat past in de lijn die Peking de afgelopen maanden uitzet, zoals bij het open-sourceblok dat Xi binnen de BRICS opzet.

Wat het model volgens het paper kan
De training draait om wat het lab een Verifiable Experience Pipeline noemt: het model leert van toolgebruik in echte, uitvoerbare omgevingen waarin het resultaat extern controleerbaar is. Het paper, met 143 auteurs, verdeelt de taken in vier categorieen: onderzoek, bouwen, opleveren en cybersecurity.
De gepubliceerde cijfers lopen uiteen. Op DeepSearchQA staat 96,0 procent en op BrowseComp 92,5 procent, terwijl DeepResearch Bench II op 51,1 procent blijft steken. Bij softwaretaken noteert het lab 86,2 procent op MLE-bench Lite, 59,6 procent op SWE-bench Pro en 78,3 procent op Terminal-Bench. CyberGym komt uit op 86,5 procent. Over zestien benchmarks heen claimt het lab op vijf ervan de hoogste gepubliceerde score.
Die scores komen van de makers zelf. Onafhankelijke verificatie ontbreekt nog, en juist bij agentische taken is het gat tussen benchmark en praktijk groot: frontier-modellen struikelen op echte bedrijfscode terwijl ze op publieke tests hoog scoren. Een menselijke evaluatie in het paper, met 769 taakregistraties van 56 deelnemers, meldt dat ongeveer een derde van de taken zonder AI-hulp als onhaalbaar werd beoordeeld.
Wat betekent dit
Voor Nederlandse bedrijven is de licentie interessanter dan de benchmarkscores. Een model van deze klasse dat je zelf mag draaien, betekent dat gevoelige data binnen de eigen infrastructuur kan blijven. Daar staat tegenover dat 744 miljard parameters serieuze hardware vraagt, dus in de praktijk gaat het om cloudpartijen die het aanbieden, niet om een server onder de trap.
Het patroon van de release verdient aandacht. Gewichten eerst, documentatie drie dagen later, geen persbenadering. Het verkort de periode waarin buitenstaanders een model kunnen beoordelen voordat het in productie belandt. Precies over dat soort toezicht botsen Chinese en Amerikaanse partijen al maanden, en een vrij te downloaden model van 744 miljard parameters maakt die discussie niet eenvoudiger.
