Claude Opus 5 pakt agentische benchmarks van Sol
Anthropic bracht op 24 juli Claude Opus 5 uit en de eerste onafhankelijke metingen zijn binnen. Op een nieuwe reeks agentische codeertaken loopt het model voor op OpenAI’s GPT-5.6 Sol. Op de klassieke terminaltest houdt Sol juist de kop. Wie wint hangt dus af van wat je meet.
Frontier-Bench v0.1 legt de lat hoger
Frontier-Bench v0.1 is een reeks van 74 agentische codeertaken, opgezet als opvolger van Terminal-Bench 2.1. Op maximale rekeninzet haalt Claude Opus 5 43,3 procent, tegen 34,4 procent voor GPT-5.6 Sol, zo melden techsites als Codersera en buildfastwithai op basis van de gepubliceerde scores. Opus 4.8 bleef op dezelfde test op 21,1 procent steken, dus binnen Anthropics eigen lijn is de sprong groot. We schreven eerder al dat Opus 5 vooral vooruitgang boekt in agentisch werk. Op ARC-AGI-3, een test voor nieuw redeneren, is het gat nog breder: 30,2 procent voor Opus 5 tegen 7,8 procent voor Sol. Op SWE-bench Pro noteert Opus 5 volgens dezelfde bronnen 79,2 procent.
Waar GPT-5.6 Sol vooroploopt
Op TerminalBench, de test voor werk op de commandline, staat GPT-5.6 Sol juist bovenaan met 65,9 procent, gevolgd door Claude Fable 5 (62,9 procent) en GPT-5.5 (60,6 procent) volgens de leaderboardcijfers van pricepertoken. Sol kwam eind juni op de markt als deel van een reeks van drie GPT-5.6-modellen, naast Terra en Luna. De les is dat een enkele benchmark zelden het hele beeld geeft. Opus 5 is sterker in langere, agentische ketens, terwijl Sol losse terminalopdrachten vlotter afhandelt.

Prijs en contextvenster
Anthropic zet Opus 5 op 5 dollar per miljoen invoertokens en 25 dollar per miljoen uitvoertokens, met een contextvenster van een miljoen tokens en een schakelaar voor rekeninzet. Dat is ongeveer de helft van wat het vorige topmodel van Anthropic kostte. GPT-5.6 Sol vraagt hetzelfde invoertarief, maar rekent 30 dollar voor uitvoer. Voor teams die veel tekst laten genereren telt dat verschil op in de maandrekening.
Wat betekent dit
Voor wie een model kiest, is de kern dat de keuze taakafhankelijk blijft. Bouw je agents die zelfstandig lange taken doorlopen, dan spreken de cijfers op Frontier-Bench en ARC-AGI-3 voor Opus 5. Draait je werk om snelle terminalacties of codetooling, dan blijft Sol een serieuze optie, net als goedkopere hulpmiddelen zoals SWE-1.7 in Devin. Reken ook mee wat een overstap kost aan herinrichting van je workflow. En let op de veiligheidskant: de AI Safety Index van 2026 liet zien dat rekenkracht en risicobeheersing niet vanzelf gelijk oplopen. De metingen van deze week bevestigen vooral dat de top dicht bij elkaar zit en per meetlat verschuift.
