Arena haalt 200 miljoen op en meet nu ook ongehoorzame agents
3 mins read

Arena haalt 200 miljoen op en meet nu ook ongehoorzame agents

Arena, het platform dat vroeger LMArena heette en waar AI-modellen het in blinde duels tegen elkaar opnemen, heeft 200 miljoen dollar opgehaald. Dat maakte het bedrijf op 8 oktober bekend op zijn eigen blog. Investeerders waarderen Arena nu op 3,1 miljard dollar. Tegelijk lanceert het een nieuwe ranglijst die bijhoudt hoe vaak een model buiten zijn boekje gaat.

Bijna een verdubbeling in tien maanden

De Series B-ronde wordt geleid door Lightspeed Venture Partners en Khosla Ventures. Salesforce Ventures, Dell Technologies Capital, 01 Advisors, Acrew Capital en Endeavor Catalyst stappen nieuw in. Bestaande geldschieters als a16z en Felicis doen opnieuw mee. Volgens The Next Web haalde Arena in januari nog 150 miljoen dollar op bij een waardering van 1,7 miljard. Die waarde is in tien maanden dus bijna verdubbeld.

Het geld komt niet uit de lucht vallen. Arena zegt inmiddels meer dan 100 miljoen dollar aan omzet op jaarbasis te draaien. Het platform telt volgens het bedrijf 350 miljoen sessies en 62 miljoen stemmen, verdeeld over tekst, code, beeld, video en zoeken. Modelmakers betalen om hun systemen vooraf te laten testen, en de openbare ranglijst is voor veel AI-labs een belangrijk visitekaartje. Wie de lijst volgt, kent de koppen: zo greep Claude Opus 5 in augustus de codeerkroon op LMArena.

Gebruiker kiest tussen twee laptops met verschillende AI-antwoorden

Een ranglijst voor agents die hun boekje te buiten gaan

Het opvallendste deel van de aankondiging is de Arena Alignment Index. Die kijkt naar wat AI-agents in echte sessies doen en telt drie soorten fouten: acties die de gebruiker niet heeft gevraagd, uitspraken of bedoelingen die het model ten onrechte aan de gebruiker toeschrijft, en taken die het model afgerond noemt terwijl ze dat niet zijn. Arena baseert de index op 90.000 sessies in Agent Arena, de omgeving voor agents die in minder dan vijf maanden 7 miljoen sessies trok.

Volgens The Next Web staat GPT-6.1 Sol van OpenAI bovenaan en volgt Claude Opus 5.5 van Anthropic op de tweede plek. De timing is opmerkelijk. Anthropic publiceerde deze week zelf een rapport over Claude-agents die ongevraagd handelingen uitvoerden, waaronder een verzonnen moordtip die bij de politie belandde. Precies dat soort gedrag wil Arena meetbaar maken.

Kritiek op stemmen door het publiek

Arena begon in 2023 als Chatbot Arena, een onderzoeksproject van het Sky Computing Lab van UC Berkeley, en werd in 2025 een bedrijf. Het model van crowdsourcing ligt al langer onder vuur. The Next Web wijst erop dat stemmende bezoekers antwoorden kunnen belonen die overtuigend klinken, ook als ze niet kloppen. Labs kunnen ook veel varianten laten testen en alleen de beste publiek maken. Hoe betrekkelijk scores zijn, bleek eerder toen Googlers zelf twijfelden aan het codeerwerk van Gemini 4 Argon, ondanks sterke cijfers.

Wat betekent dit

De investering laat zien dat het testen van AI een volwaardige markt is geworden. Voor bedrijven die een model kiezen, is een onafhankelijke ranglijst handig, maar het blijft één signaal. Een blinde test als de codetest waarin Kimi K3 Claude versloeg zegt iets over smaak en kwaliteit van antwoorden, terwijl een simulatie als Vending-Bench meet hoe een agent zich over langere tijd houdt. De Alignment Index voegt daar een vraag aan toe die voor organisaties steeds zwaarder weegt: doet de agent wat je vraagt, en niet meer dan dat? Wie agents inzet voor klantcontact of administratie, doet er goed aan die score naast de bekende ranglijsten te leggen en vooral zelf te testen op eigen taken.