Z.ai houdt gewichten van GLM-5.3 twee weken achter
3 mins read

Z.ai houdt gewichten van GLM-5.3 twee weken achter

Het Chinese Z.ai (voorheen Zhipu AI) heeft GLM-5.3 uitgebracht en noemt het zijn sterkste codeermodel tot nu toe. Opvallender dan de scores is wat er niet meteen bij zit: de gewichten blijven ongeveer twee weken achter de deur, totdat de veiligheidsevaluatie is afgerond. Voor een lab dat zijn reputatie op open modellen heeft gebouwd is dat een breuk met de eigen gewoonte.

De winst zit in de nabehandeling

GLM-5.3 draait op precies hetzelfde basismodel van 743 miljard parameters als GLM-5.2. Volgens de aankondiging van Z.ai komt alle vooruitgang uit opgeschaalde post-training: meer taakomgevingen, meer soorten omgevingen en langere trainingsloops. Er is dus geen nieuwe architectuur en geen nieuwe pre-training run.

De sprong is het grootst bij taken die lang doorlopen. Op Terminal-Bench 3.0 gaat het model van 4,6 naar 28,3 punten, op DeepSWE v1.1 van 46,2 naar 66,9. Op de eigen Code Bench van Z.ai scoort GLM-5.3 31,4 procent bij ongeveer 50.000 uitvoertokens per taak, tegen 29,5 procent voor Claude Opus 4.8 op dezelfde test. Claude Fable 5 blijft met 39,5 procent op maximale inspanning voorop. Dat zijn cijfers van de maker zelf, en die vragen om onafhankelijke controle zodra de gewichten er zijn.

Twee beveiligingsonderzoekers overleggen bij een whiteboard

Van losse bugs naar complete exploitketens

Z.ai trainde het model gericht op het vinden van softwarekwetsbaarheden, en daar loopt de curve het steilst. Op CyberGym gaat de score van 77,2 naar 84,5 procent, op ExploitBench meer dan verdubbelt hij: van 24,4 naar 54,4 procent. In de aankondiging schrijft het bedrijf dat het model “over meerdere stadia van exploitatie begon te redeneren en samenhangende plannen vormde voor volledige exploitketens”. Dat gedrag stond niet als doel in de trainingsopzet.

Samen met Chinese beveiligingsteams vond Z.ai naar eigen zeggen 2.436 kwetsbaarheden in 269 projecten, waarvan sommige al tientallen jaren in de code zaten. Die vondsten staan in een openbaar register. The Decoder wijst erop dat Chinese modellen als Kimi en Qwen op dit vlak juist achterliepen op de Amerikaanse top, en dat GLM-5.3 dat gat gericht dichtloopt.

Waarom de gewichten wachten

Precies die cyberkant verklaart het uitstel. Z.ai publiceert de gewichten pas na afronding van de veiligheidsevaluatie en hardening, wat volgens MarkTechPost neerkomt op eind augustus. Het model is nu al te gebruiken via het GLM Coding Plan en werkt met codeeragents als ZCode, Claude Code en OpenCode.

De parallel met Amerikaanse labs dringt zich op. OpenAI zette zijn model Astra deels op slot omdat het een kritiek cyberniveau niet kon uitsluiten, en gaf eerder GPT-5.6-Cyber alleen aan verdedigers vrij. Het verschil: die modellen zijn gesloten. Zodra open gewichten online staan, is terugdraaien onmogelijk.

Wat betekent dit

Voor Nederlandse ontwikkelteams is GLM-5.3 straks een serieuze optie naast de Amerikaanse modellen, zeker omdat de vorige generatie al op bescheiden hardware draaide en de prijzen aan de Chinese kant laag blijven, ook al bewegen concurrenten als DeepSeek de andere kant op. Wie het model wil inzetten, wacht beter tot eind augustus: pas dan kunnen buitenstaanders de claims natrekken.

Voor beveiligingsteams is de boodschap directer. Een model dat zelfstandig exploitketens plant en straks vrij te downloaden is, verandert wie zulke aanvallen kan uitvoeren. Patchen op tijd was al belangrijk. Vanaf eind augustus wordt het scherper afgerekend.