benchmark
GPT-6 Astra weigert gevaarlijke robotopdracht bijna nooit
RoboHarm liet Claude Fable 5.1, GPT-6 Astra en MolmoAct2 robotarmen aansturen met vijf gevaarlijke opdrachten. In 300 tests weigerde bijna geen enkel model consequent.
Frontier-modellen falen op echte bedrijfscode
Benchmark Real-SWE test AI-codeermodellen op private productiecode van drie bedrijven. Fable 5.1 wint met 38,8 procent, GPT-5.6 Sol blijft op 16,2 procent steken.
Meta klimt met Muse Spark 1.3 naar de wereldtop
Meta bracht Muse Spark 1.3 uit, met 61 punten op de Intelligence Index van Artificial Analysis en een taakprijs van 0,55 dollar, ruim onder GPT-5.6 Sol en Grok 4.6.
Cogent VR-1 bewijst aanvalspaden in bedrijfsnetwerken
Cogent Security bracht VR-1 uit, een frontier-model dat is getraind om aanvalspaden in bedrijfsnetwerken te vinden en te bewijzen. Op de eigen IntrusionBench claimt het twee keer zoveel resultaat als generalistische modellen.
Claude Opus 5 grijpt de codeerkroon op LMArena
Claude Opus 5 staat ruim een week na de release bovenaan de codeerranglijsten van LMArena en Artificial Analysis, net voor Kimi K3. De prijs blijft gelijk.
OpenAI publiceert Frontier Governance Framework: waarom governance nú samenvalt met agent-benchmarks
OpenAI publiceert een Frontier Governance Framework. Wat betekent dit voor EU AI Act, audits en agentic AI — en waarom benchmarks en unlearning ineens cruciaal worden?
