GLM-5.2 draait op een laptop met 25GB RAM
3 mins read

GLM-5.2 draait op een laptop met 25GB RAM

Een model met 744 miljard parameters op je eigen laptop, zonder videokaart en met 25GB geheugen. Dat klonk tot voor kort onmogelijk. Toch laat een klein hulpprogramma met de naam Colibri precies dat zien met GLM-5.2, het grote taalmodel van het Chinese Zhipu AI. De code staat open op GitHub en de aanpak trekt deze week veel aandacht in de open-source-hoek.

Hoe Colibri het geheugen omzeilt

GLM-5.2 is een mixture-of-experts-model. Van de 744 miljard parameters zijn er per token maar zo’n 40 miljard actief, verdeeld over 256 experts per laag waarvan er telkens acht plus een gedeelde expert aan de beurt komen. Colibri buit dat uit. Het houdt alleen de dichte lagen, dus de attentie, de gedeelde experts en de embeddings, in het werkgeheugen. Dat is ongeveer 17 miljard parameters, in int4 teruggebracht tot 9,9GB. De ruim 21.000 gestuurde experts, samen zo’n 370GB, blijven op de schijf staan en worden pas ingeladen op het moment dat een token ze nodig heeft. Dat schrijft ontwikkelaar JustVugg in de documentatie bij het project op GitHub.

Het geheel is geschreven in puur C, zonder Python-afhankelijkheden tijdens het draaien. Techsite Gigazine en Tom’s Hardware beschreven de methode als een serieuze poging om zware modellen naar consumentenhardware te brengen.

De prijs: geduld

Handen typen op een laptop in een donkere kamer met een externe harde schijf op de achtergrond

Gratis is dit niet. De ontwikkelaar meet een snelheid van 0,05 tot 0,1 token per seconde, dus een nieuw woorddeel elke tien tot twintig seconden. Een kort antwoord van honderd tokens kost zo een half uur, en dan is het verwerken van de vraag zelf nog niet meegerekend. De flessenhals zit hem in het streamen van de experts vanaf de schijf. Een snelle NVMe-SSD helpt, een trage harde schijf maakt het onwerkbaar.

Voor een chatbot is die snelheid te laag. Voor wie een groot model lokaal wil bestuderen, testen of finetunen zonder dure hardware, opent het wel een deur. De rekenkracht voor AI is schaars en duur geworden, en juist daarom zoeken ontwikkelaars naar manieren om meer uit bestaande machines te halen.

Waarom lokaal draaien telt

De aanpak past in een bredere beweging. Apple bekijkt met PrismML hoe zwaardere modellen op een telefoon kunnen draaien, en AI-labs bouwen hun eigen inferentiechips om kosten te drukken. Colibri kiest de andere kant op: geen nieuwe hardware, maar slimmer omgaan met wat er al is. Dat sluit aan bij de opkomst van open modellen zoals het werk van Mistral, waar de code en de gewichten vrij beschikbaar zijn. Wie een plek in de chiprace mist, kan zo toch met frontier-modellen experimenteren.

Wat betekent dit

Colibri is nog een proof of concept, geen kant-en-klaar product. De trage output maakt het ongeschikt voor dagelijks gebruik, maar de techniek laat zien dat de grens tussen datacenter en laptop dunner wordt dan gedacht. Als het streamen van experts sneller kan, bijvoorbeeld met betere caching of snellere opslag, komt lokale AI met grote modellen binnen bereik van hobbyisten, onderzoekers en kleine bedrijven. Dat verschuift de vraag van wie de grootste GPU-cluster heeft naar wie het slimst omgaat met geheugen en schijf.