Videomodel MiniMax-H3 rendert sneller dan afspelen
Een videomodel dat sneller rendert dan je de beelden kunt afspelen: dat is wat MiniMax en NVIDIA Research deze week lieten zien met Sol-H3, een nieuwe inferentiestack voor het open videomodel MiniMax-H3. Vijf seconden video met geluid, klaar in 1,653 seconden.
De cijfers achter Sol-H3
Op de projectpagina van NVIDIA Research staan de meetresultaten per opstelling. Een clip van vijf seconden op 1344×768 en 24 beelden per seconde, inclusief stereogeluid, kost op acht B300-versnellers van NVIDIA 1,653 seconde. Op vier kaarten wordt dat 2,918 seconde, op een enkele kaart 13,745 seconde. Tien seconden video duurt op de achtkaartsopstelling 3,732 seconde, vijftien seconden 6,612 seconde. Vergeleken met het basismodel H3 op vijftig stappen ligt de winst tussen 9,45 en 15,54 keer.
Onderzoeker Enze Xie kondigde het werk aan op X met de samenvatting die de kern raakt: vijf seconden wereld, 1,653 seconde rekentijd. De code staat onder Apache 2.0 op GitHub, de modelgewichten blijven onder de oorspronkelijke licentie van MiniMax-H3 vallen.

Waar de snelheidswinst vandaan komt
Sol-H3 is geen nieuw model maar een hertimmerde runtime. De grootste post is Sol-Attn, een vorm van dunne aandacht die per query bepaalt welke delen van de berekening ertoe doen. Dat werkt zonder hertraining, wat het verschil maakt tussen een onderzoeksdemo en iets dat je vandaag op bestaande gewichten kunt zetten.
Verder zijn normalisatie, RoPE en de MLP-lagen samengevoegd tot enkele kernels. Het verkeer tussen de acht GPU’s gaat in INT8 voor de QKV-tensoren en FP8 voor de uitvoer, wat de te versturen data met 51,6 procent verkleint. Het decoderen van de VAE gebeurt parallel over tegels, en de conditionering van AdaLN wordt vooraf berekend, waarmee ongeveer 400 kernel-launches per stap verdwijnen. De voorbereiding van de dunne aandacht zelf werd 76,4 procent sneller.
Losse trucs dus, gestapeld in een runtime. Precies het soort werk dat zelden een persbericht haalt, maar dat de rekenrekening van een videodienst halveert. Dezelfde beweging zagen we eerder bij DLSS 5, waar NVIDIA neurale technieken in de renderpijplijn schoof.
Open gewichten winnen terrein
MiniMax-H3 hoort bij een groep Chinese videomodellen waarvan de gewichten grotendeels beschikbaar zijn. Alibaba koos bij Wan3.0 juist voor een gesloten variant, terwijl MiniMax de andere kant op ging. Dat betaalt zich nu uit: omdat de gewichten toegankelijk zijn, kon een extern team als NVIDIA Research er een complete optimalisatielaag omheen bouwen. Bij een gesloten model gebeurt dat niet.
MiniMax bouwt zo aan een positie buiten China. Het Saoedische Humain koos de modellen van het bedrijf als basis voor zijn Arabische topmodel M3. Generatieve media zitten ondertussen in de brede consumentenmarkt, zoals Google liet zien met Lyria 3.5 in de Gemini-app.
Wat betekent dit
Videogeneratie was tot nu toe iets waar je op wacht: prompt insturen, koffie halen, resultaat bekijken. Bij 1,653 seconde voor vijf seconden beeld verdwijnt dat wachten. Dan wordt interactief werken mogelijk, met een variant genereren terwijl je nog aan de vorige denkt, of video die tijdens een sessie ontstaat in plaats van vooraf.
De opstelling waarop dit gemeten is, acht B300-kaarten, staat niet bij het gemiddelde productiebedrijf op zolder. Maar de prijs per gegenereerde seconde daalt met dezelfde factor, en dat telt door in wat aanbieders straks vragen. Voor iedereen die video inkoopt of maakt is de rekensom over een jaar een andere dan nu. De GPU-inkoop van de grote cloudpartijen maakt duidelijk dat de capaciteit er komt.
