DeepSeek V4 Pro nu algemeen beschikbaar, zonder aankondiging
DeepSeek heeft de definitieve versie van zijn grootste model uitgebracht, en deed dat zonder aankondiging. Geen blogpost, geen bericht op X. Het enige signaal was een aangepaste prijspagina in de API-documentatie op 12 augustus, waarin DeepSeek-V4-Pro-0813 opdook als algemeen beschikbare versie. Daarmee eindigt een preview die sinds 24 april liep.
Wat er verandert ten opzichte van de preview
De winst zit vooral in agentisch programmeren, het werk waarbij een model zelfstandig een terminal bedient, code aanpast en test. DeepSeek claimt op DeepSWE een sprong van 12,8 naar 62,7 punten, op CyberGym van 52,7 naar 83,3 en op Terminal-Bench 2.1 van 72,1 naar 87,9. Dat zijn geen kleine correcties, maar een ander model in de praktijk.
Die cijfers komen wel van DeepSeek zelf. TechTimes wees er in zijn bericht over de release op dat onafhankelijke verificatie nog ontbreekt op trackers als benchable.ai. De eerste externe meting laat al verschil zien: Artificial Analysis komt op Terminal-Bench v2.1 uit op 79 procent, ruim onder de 87,9 die DeepSeek noemt. Bij eerdere releases van andere aanbieders zagen we hetzelfde patroon, zoals toen Google Gemini 3.5 Pro uitstelde vanwege tegenvallende coderesultaten.

Sterk in de breedte, niet aan de top
Op de Artificial Analysis Intelligence Index scoort V4 Pro 53. Dat is precies één punt boven de eigen V4 Flash van 31 juli, en een flink eind onder de gesloten koplopers: Claude Opus 5 staat op 63, Fable 5 op 62, GPT-5.6 Sol en Grok 4.6 op 61 en Kimi K3 op 60. Per losse test loopt het uiteen. Op GPQA Diamond, wetenschappelijk redeneren op promovendusniveau, haalt het model 93 procent en zit het gelijk met de top. Op SciCode blijft het steken op 49 procent.
In de vergelijking met Opus 4.8 wint DeepSeek op Terminal-Bench 2.1, CyberGym, DeepSWE en AutomationBench, en verliest het op HLE, NL2Repo en de zwaardere DSBench-varianten. Wie een model zoekt dat lange terminalsessies afmaakt, krijgt hier veel waar voor weinig geld. Wie diepe redeneertaken draait, merkt het gat.
De prijs is het echte argument
Via OpenRouter kost het model 0,435 dollar per miljoen invoertokens en 0,87 dollar per miljoen uitvoertokens, met een contextvenster van 1 miljoen tokens. Met caching zakt de invoerprijs volgens de documentatie naar 0,004 dollar per miljoen tokens. Artificial Analysis rekent dat om naar ongeveer 0,06 dollar per taak op de index, de op één na goedkoopste optie in het hele veld.
Dat verklaart waarom Chinese aanbieders zoveel druk zetten op de prijzen. We zagen het eerder bij Qwen3.8 van Alibaba en bij de open agentmodellen van NVIDIA. Voor teams die per maand miljarden tokens verstoken, en dat zijn er meer dan je denkt gezien de oplopende tokenkosten bij bedrijven als Rippling, telt een factor tien in prijs zwaarder dan tien punten op een index.
Wat betekent dit
Voor Nederlandse ontwikkelteams is dit vooral een reden om de eigen mix opnieuw te bekijken. Routinewerk als tests schrijven, refactoren en logs uitpluizen kan naar een goedkoop model, terwijl het duurdere model alleen nog de lastige stukken doet. Test dat wel zelf met je eigen codebase voordat je omschakelt. Zolang de cijfers van DeepSeek komen en niemand ze heeft nagerekend, zegt een benchmark minder dan een week meedraaien in je eigen pijplijn. Houd ook rekening met de vraag waar je data terechtkomt: DeepSeek draait in China, en dat is voor veel organisaties een aparte afweging.
