Kimi K3 nadert de top bij langdurige AI-taken
Moonshot AI zet zijn nieuwste model steviger op de kaart. Kimi K3, het Chinese model dat vorige week verscheen, klimt op de ranglijsten voor langdurige, zelfstandige taken. Volgens meetbureau Artificial Analysis staat het inmiddels op de tweede plaats voor werk dat uren aan planning en tussenstappen vergt, achter alleen Claude Fable 5 van Anthropic.
Wat Artificial Analysis meet
Artificial Analysis draait een eigen, niet-openbare test voor langdurig kenniswerk: opdrachten die een model niet in een enkel antwoord afrondt, maar via een reeks stappen. Kimi K3 haalt daar een Elo van 1547, een sprong van 732 punten ten opzichte van de vorige versie K2.6. Alleen Claude Fable 5 scoort hoger. Ontwikkelaar Simon Willison, die het model uittestte, wijst erop dat K3 in de eigen cijfers van Moonshot ook Claude Opus 4.8 en GPT-5.5 voorbijstreeft, al blijft het achter op GPT-5.6 Sol. Opvallend is dat K3 volgens Willison zo’n 21 procent minder uitvoertokens verbruikt dan zijn voorganger, wat de rekening bij lange opdrachten drukt. Eerder liet het model al zien wat het kan met code, toen het bovenaan eindigde in de code-arena van Arena.ai.

Open gewichten, gesloten concurrentie
Met 2,8 biljoen parameters is Kimi K3 het grootste model dat als open gewichten naar buiten komt. Moonshot beloofde die gewichten uiterlijk 27 juli vrij te geven, iets wat het bedrijf al bij de lancering aankondigde. Dat plaatst K3 in een groeiende groep Chinese open modellen die de afstand tot de dure, gesloten systemen uit de VS verkleinen. Ook DeepSeek rolde onlangs een nieuwe versie uit. De prijs via de API ligt op 3 dollar per miljoen invoertokens en 15 dollar per miljoen uitvoertokens, ruim onder de tarieven van de westerse topmodellen. Een kanttekening: K3 kent voorlopig maar een rekenstand, de zwaarste (“max”), zonder lichtere en snellere varianten.
Wat dit betekent
De cijfers passen in een bekend patroon. Waar westerse labs lang de duurste en beste modellen leverden, komt de druk nu van open modellen die vlak onder de top presteren voor een fractie van de prijs. Voor bedrijven die AI-agenten willen inzetten voor werk dat uren duurt, verschuift de rekensom. Wie 90 procent van de kwaliteit voor een kwart van de kosten krijgt, kijkt anders naar het allerbeste model. Tegelijk blijft de bovenkant in Amerikaanse handen, want Claude Fable 5 en GPT-5.6 Sol staan nog boven K3. Die spanning voedt ook het politieke debat over de AI-race tussen de VS en China. Voor Moonshot is de echte test 27 juli, als iedereen de gewichten kan downloaden en de claims zelf kan natrekken.
