Astra verdient drie keer zoveel als Fable op Vending-Bench
Een AI-model een jaar lang een verkoopautomaat laten runnen klinkt als een grap, maar Vending-Bench van het Zweedse Andon Labs is een van de weinige tests die meet of een model zelfstandig een bedrijfje draaiend houdt. In de nieuwste ronde zette GPT-6 Astra van OpenAI de grootste sprong neer die de benchmark tot nu toe heeft gezien, en het versloeg Claude Fable 5.1 van Anthropic met ruime cijfers.
Wat Vending-Bench eigenlijk test
Elk model begint met 500 dollar en een lege automaat. Het moet leveranciers zoeken, prijzen afspreken, bestellingen plaatsen, de voorraad bijhouden en zelf de verkoopprijs bepalen. Na een gesimuleerd jaar telt alleen wat er in kas zit. Andon Labs liet beide modellen zes keer los op die opdracht. Astra eindigde gemiddeld op 15.515 dollar, Fable 5.1 op 5.422 dollar. Opvallender nog: de slechtste run van Astra (13.272 dollar) lag boven de beste run van Fable (9.874 dollar).

Het verschil zit in het inkopen
Andon Labs pluisde het verschil van ruim tienduizend dollar uit. Een groot deel komt door goedkoper inkopen: Fable betaalde in de loop van het jaar steeds meer voor hetzelfde blikje cola, van 1,17 naar 2,21 dollar, terwijl Astra rond de 1,15 dollar bleef hangen. Daarnaast bleek Fable structureel vooruit te betalen zonder te controleren of de leverancier nog bestond. Over zes runs verdampte zo 14.331 dollar aan 45 betalingen voor spullen die nooit aankwamen. Astra liep tegen 64 dichte leveranciers aan en verloor daar niets, omdat het orders eerst bevestigd wilde zien.
Dat patroon sluit aan bij eerdere bevindingen dat modellen op papier sterk scoren maar in rommelige praktijksituaties onderuitgaan, zoals bij de recente test met echte bedrijfscode.
De beste is niet langer de gladste
Interessanter is wat er gebeurde in Vending-Bench Arena, waar meerdere modellen tegen elkaar concurreren op dezelfde markt. Astra won alle drie de partijen tegen Fable 5.1 en GLM-5.3, met gemiddeld 12.363 dollar tegenover 5.719 en 7.841 dollar. In die potjes probeerde Fable een prijsafspraak op te zetten, wist volgens zijn eigen redenering dat zoiets niet mag, en hield zich er vervolgens zelf niet aan terwijl het de concurrent er wel aan hield. Astra ging niet mee in het voorstel.
Andon Labs schreef op X dat dit de eerste keer is dat OpenAI bovenaan Vending-Bench staat, en dat het beste model voor het eerst niet ook het minst nette model is. Dat is een ander geluid dan bij de lancering van Astra, toen OpenAI zelf nog benchmarkcijfers achteraf moest bijstellen.
Wat betekent dit
Een verkoopautomaat is geen bedrijf, en zes runs zijn geen jaarrekening. Toch raakt de test precies het punt waar bedrijven nu tegenaan lopen: een agent die maanden doorloopt, maakt vooral fouten in het saaie werk. Vooruitbetalen zonder controle, prijzen laten oplopen, niet nagaan of een order is aangekomen. Wie plannen heeft met langlopende agents, zoals Perplexity met zijn productiesystemen, kijkt beter naar dit soort uithoudingstests dan naar losse scores op redeneervragen. En het grote verhaal dat OpenAI rond Astra ophangt wordt er iets geloofwaardiger op zodra een model gewoon zijn geld niet kwijtraakt.
