Benchmarks
Astra verdient drie keer zoveel als Fable op Vending-Bench
GPT-6 Astra hield na een gesimuleerd jaar 15.515 dollar over op Vending-Bench, tegen 5.422 dollar voor Claude Fable 5.1. Het verschil zit in inkoop en in betalingen die nooit iets opleverden.
OpenHands 1.0 haalt 68 procent op SWE-bench Verified
De open-source codeagent OpenHands bereikt versie 1.0 met Docker-sandboxing, risicoanalyse per commando en ongeveer 68 procent op SWE-bench Verified.
Nemotron verslaat beste mens op programmeerolympiade
NVIDIA’s Nemotron-3-Ultra-CC scoorde 535,4 van 600 punten op de Internationale Olympiade Informatica 2026 en bleef daarmee boven de beste menselijke deelnemer met 498,27.
OpenAI noemt GPT-6 Astra het begin van het AGI-tijdperk
OpenAI lanceerde GPT-6 Astra en spreekt van het AGI-tijdperk. Wat het model kan, wat het kost en waarom het als eerste het stempel critical krijgt voor cyber.
Qwen-UI-Agent van Alibaba verslaat GPT-5.6 op telefoons
Alibaba brengt Qwen-UI-Agent uit, een model dat schermen bedient op telefoon, pc en browser. Op mobiele benchmarks scoort het hoger dan GPT-5.6 Sol en Claude Opus 4.8.
Kennislaag Pinecone verslaat agents van OpenAI en Google
Een agent met Pinecone Nexus als kennislaag pakte de topscore op de τ-Knowledge-benchmark van Sierra, boven agents op modellen van OpenAI, Anthropic en Google.
Mysteriemodel Ox Alpha wijst volgens speurwerk naar Z.ai
Het anonieme model stealth/ox-alpha scoort 80 procent op DeepSWE en is gratis tot 27 augustus. Tokenizer- en video-analyses wijzen naar GLM-5.3 van Z.ai.
Qwen-UI-Agent van Alibaba bedient schermen beter dan GPT-5.6
Alibaba’s Qwen-UI-Agent leest schermen en bedient telefoons en pc’s zelf. Op MobileWorld scoort het model 14,6 procentpunt boven Claude Opus 4.8, maar op de zware desktoptest OSWorld-v2 blijft het steken op 13,9 procent.
Kimi K3 verslaat Claude in blinde codetest
Moonshot AI zette de open gewichten van Kimi K3 een dag te vroeg online. Het model van 2,8 biljoen parameters pakt de eerste plek op de Frontend Code Arena van LMArena, boven Claude Fable 5.
Claude Opus 5 pakt agentische benchmarks van Sol
Claude Opus 5 wint op Frontier-Bench en ARC-AGI-3, maar GPT-5.6 Sol houdt de leiding op TerminalBench. De cijfers en tarieven op een rij.
