Meta Muse Spark 1.1 leidt agent-benchmarks
3 mins read

Meta Muse Spark 1.1 leidt agent-benchmarks

Meta heeft zijn agentmodel Muse Spark 1.1 bovenaan meerdere benchmarks voor autonome taken zien belanden. Het model van Meta Superintelligence Labs, dat op 9 juli verscheen, laat vooral zien hoe goed het gereedschappen bedient en computers zelfstandig bestuurt. Volgens een overzicht van BuildFastWithAI voert het de lijstjes voor tool-gebruik en agentwerk aan, ruim voor modellen die op papier groter zijn.

Sterk in gereedschap en computergebruik

Muse Spark 1.1 is een multimodaal redeneermodel dat is getraind om taken over langere tijd af te maken. Het beschikt over een contextvenster van een miljoen tokens en kan die ruimte actief beheren: het onthoudt eerdere stappen, haalt informatie van veel eerder terug en comprimeert wat het niet direct nodig heeft. Meta beschrijft in zijn eigen aankondiging dat het model werk kan doorgeven aan subagenten die parallel draaien, en dat het interfaces op desktop, mobiel en in de browser bedient.

Op de MCP Atlas-benchmark voor tool-gebruik scoort het model 88,1, de hoogste van het testveld, aldus de analyse van MarkTechPost. Bij coderen en multimodale taken staat het rond de derde plek. De agentische kant is dus de kracht, niet per se de pure programmeervaardigheid.

Voorop bij baan- en financietaken

Toetsenbord en muis op een bureau, een AI-agent die computertaken uitvoert

De duidelijkste voorsprong laat Muse Spark 1.1 zien op evaluaties die echt werk nabootsen. Het model gaat aan de leiding op JobBench en Finance Agent V2, twee tests die respectievelijk kantoortaken en financiële opdrachten simuleren. Die scores zeggen meer over dagelijks nut dan een losse redeneerpuzzel: het gaat om een keten van acties waarbij een fout halverwege de hele taak kan laten mislukken. Dat Meta hier bovenaan staat past bij de trend dat modellen steeds vaker op langdurige taken worden beoordeeld, iets wat ook Moonshots Kimi K3 de afgelopen weken liet zien.

Scherpe prijs en brede toegang

Meta zet het model neer tegen een lage prijs. Via de Meta Model API kost het 1,25 dollar per miljoen invoertokens en 4,25 dollar per miljoen uitvoertokens, met 20 dollar aan gratis tegoed om te starten. Consumenten kunnen het bovendien gratis gebruiken in de Meta AI-app via de Thinking-modus, meldt DataCamp. Die combinatie van agentprestaties en een lage prijs zet druk op concurrenten die hun sterkste agents duurder aanbieden.

Opvallend is dat Meta hiermee verder afstapt van zijn open-only aanpak. Muse Spark 1.1 kwam eerder deze maand naar buiten als betaalde API, een breuk met de gratis open gewichten waar het bedrijf bekend om stond. De nieuwe benchmarkscores geven dat commerciële spoor extra gewicht.

Wat betekent dit

Voor ontwikkelaars die agents willen bouwen die echt taken afronden, komt er een goedkoop en capabel alternatief bij. De sterke resultaten op JobBench en Finance Agent V2 wijzen op praktische inzet in kantoor- en financiewerk, al blijven benchmarks een momentopname en geen garantie voor de weerbarstige praktijk. De echte test volgt zodra bedrijven het model op hun eigen processen loslaten. Wie de bredere strijd om AI-agents volgt, ziet dat de concurrentie niet alleen op ruwe intelligentie draait maar net zo hard op betrouwbaar uitvoeren, zoals ook blijkt uit platforms als de bedrijfsagent van NVIDIA en ServiceNow.