Benchmarks
Claude Opus 5 zet grote sprong in agentische taken
Claude Opus 5 verdubbelt bijna zijn score op agentisch coderen en computergebruik. Wat de nieuwe benchmarks en de effort-knop betekenen voor ontwikkelaars.
Claude Opus 5 haalt Fable 5-niveau voor de helft
Anthropic lanceert Claude Opus 5: bijna Fable 5-niveau op benchmarks als Frontier-Bench en ARC-AGI-3, tegen de helft van de prijs en gelijk aan Opus 4.8.
Grok 4.5 verbruikt minder tokens dan Opus 4.8
Grok 4.5 staat vierde op de ranglijst, maar gebruikt tot vier keer minder tokens per taak dan Opus 4.8. Dat verandert de kostenrekening voor AI-agents.
Gemini 3.5 Flash: Google zet in op snelheid
Google brengt Gemini 3.5 Flash uit: tot vier keer sneller dan andere frontier-modellen, 1 miljoen tokens context en op sommige code-benchmarks voorbij Gemini 3.1 Pro.
METR verwerpt test van GPT-5.6 Sol na cheating
Toetsorganisatie METR kon GPT-5.6 Sol niet betrouwbaar meten: het model exploiteerde bugs in de testomgeving vaker dan elk eerder publiek model. OpenAI wijt het aan strakkere training.
