Claude Opus 5 zet grote sprong in agentische taken
2 mins read

Claude Opus 5 zet grote sprong in agentische taken

De aandacht rond Claude Opus 5 ging vorige week vooral over de prijs, maar de cijfers over wat het model kan zijn minstens zo interessant. Anthropic bracht het model op 24 juli uit en de eerste onafhankelijke metingen laten een flinke stap zien op precies het terrein waar bedrijven nu op inzetten: AI die zelfstandig taken uitvoert in plaats van alleen antwoorden geeft.

Bijna een verdubbeling op agentisch coderen

Op Frontier-Bench, een test voor agentisch coderen, haalt Opus 5 volgens de meting van MarkTechPost 43,3 procent, tegen 21,1 procent voor voorganger Opus 4.8. Dat is bijna een verdubbeling bij dezelfde tokenprijs van 5 dollar per miljoen invoer en 25 dollar per miljoen uitvoer. Op CursorBench 3.2 komt het model op maximale inspanning tot binnen een halve procent van het duurdere Claude Fable 5, voor ongeveer de helft van de kosten per taak.

Die sprong past in een bredere beweging bij de labs, waarbij de nadruk verschuift van losse antwoorden naar langere ketens van acties. Eerder deze week bracht Cognition zijn SWE-1.7 naar Devin met hetzelfde doel: goedkoper en betrouwbaarder code laten schrijven door een agent. Ook de nieuwe tool-aansturing in GPT-5.6 wijst op dezelfde richting.

Gang in een modern datacenter met serverracks en koel blauw licht

Computergebruik en een knop voor inspanning

De grootste winst zit in computergebruik, waarbij het model een scherm bedient en zelf door programma’s klikt. Op OSWorld 2.0 gaat Opus 5 naar 70,57 procent, tegen 55,7 procent voor Opus 4.8. Op Zapier AutomationBench, dat werkstromen tussen apps meet, scoort het 26,0 procent tegenover 17,0 procent voor Opus 4.8 en 17,4 procent voor Fable 5. Artificial Analysis zet het model bovenaan zijn Intelligence Index met een score van 61 en op 55,3 in de Agentic Index.

Nieuw is een instelbare effort-knop. Ontwikkelaars kiezen zelf of het model naar maximale intelligentie gaat of zuiniger met tokens omspringt. Het venster van een miljoen tokens blijft behouden, het model heet in de API claude-opus-5 en is de standaard op Claude Max. Wie snelheid nodig heeft, kan een fast-modus aanzetten die ongeveer 2,5 keer sneller werkt tegen het dubbele tarief. Dat de prijs gelijk bleef aan die van Opus 4.8 maakt het verschil in de praktijk groter dan de kale scores suggereren.

Wat betekent dit

Voor ontwikkelaars die agents bouwen wordt de rekensom simpeler. Een model dat op computergebruik en agentisch coderen dicht bij het topsegment komt, maar tegen een middenprijs, verlaagt de drempel om taken echt uit handen te geven. De cijfers komen nog van vroege tests en Anthropic publiceert ze deels zelf, dus onafhankelijke herhaling is welkom. Toch tekent zich een patroon af: de concurrentie draait dit jaar minder om wie het slimste antwoord geeft en meer om wie een klus van begin tot eind kan afmaken. Anthropic, dat ondertussen ook werkt aan eigen AI-chips, zet met Opus 5 vol in op dat tweede spoor.