Vals AI haalt 40 miljoen op voor eerlijker AI-tests
3 mins read

Vals AI haalt 40 miljoen op voor eerlijker AI-tests

Wie wil weten hoe goed een AI-model echt is, kijkt meestal naar de scorelijstjes van de makers zelf. Het Amerikaanse Vals AI bouwt daar een tegengeluid tegen en haalde daarvoor 40 miljoen dollar op bij een waardering van 400 miljoen. Andreessen Horowitz leidt de ronde, met 8VC, Pear VC, Bloomberg Beta, HRT Ventures en Next Ladder als medefinanciers. De boodschap achter de investering is ongemakkelijk voor de sector: op werk dat mensen daadwerkelijk doen, zakken zelfs de beste modellen vaak door de ondergrens.

De helft van het analistenwerk gaat mis

Het bekendste voorbeeld is de Finance Agent-benchmark van Vals. Daarin krijgen modellen taken voorgelegd die een junior analist op een doordeweekse dag afwerkt: cijfers uit jaarverslagen halen, meerdere documenten met elkaar rijmen, doorrekenen. Bij de versie die Vals in mei uitbracht kwam GPT-5.5 niet verder dan iets minder dan 52 procent goed. Volgens Techtimes is dat het patroon: modellen scoren prima op definitievragen en simpele opzoekacties, maar lopen vast zodra er meerdere rekenstappen achter elkaar komen of bronnen tegen elkaar moeten worden afgezet.

Die cijfers schuiven wel op. Claude Opus 4.7 haalde 64,37 procent op de tweede versie van dezelfde test, en Gemini 3.5 Flash nam daarna de koppositie over. Nog steeds betekent het dat ruwweg een op de drie taken fout gaat, in een beroepsgroep waar een verkeerd doorgetrokken getal geld kost. Voor banken en verzekeraars die hun processen aan modellen willen overlaten, is dat een ander verhaal dan de percentages die op productpagina’s staan. Kredietbeoordelaar Moody’s waarschuwde eerder al voor de groeiende afhankelijkheid van banken van een handvol AI-leveranciers.

Twee onderzoekers vergelijken testresultaten op een laptop in een lichte vergaderruimte

Meten loopt achter op bouwen

Vals vat het probleem zelf samen als een scheve verhouding: er gaan biljoenen naar het maken van intelligentie en betrekkelijk weinig naar het meten ervan. Modellen verschijnen sneller dan er goede tests voor te bedenken zijn, waardoor bestaande benchmarks snel verzadigd raken en niets meer onderscheiden. Het bedrijf werd opgericht door Rayan Krishnan (eerder Palantir en Stanford) en Langston Nashold (eerder Meta, HRT en NVIDIA), en zegt de omzet in zes maanden acht keer over te hebben gedaan ten opzichte van heel 2025, met een verdubbeld klantenbestand en een verdrievoudigd team.

Dat de resultaten inmiddels opduiken in de modelkaarten van OpenAI, Anthropic, Google, Meta en xAI zegt iets over de positie die Vals inneemt. Naast de financiering lanceerde het bedrijf Vals Smith, waarmee klanten een eigen codeerbenchmark uit een GitHub-repository kunnen laten bouwen, plus nieuwe tests rond cyberrisico, mentale gezondheid en AI-veiligheid en een uitgebreide Vals Index. Onafhankelijke tests hebben eerder laten zien hoe verrassend die uitkomsten kunnen zijn, bijvoorbeeld toen bleek dat AI-agenten uit hun eigen veiligheidstests wisten te ontsnappen.

Wat betekent dit

Voor bedrijven die AI inkopen is dit een reden om naar andere getallen te kijken dan de marketingscores. Een model dat bovenaan een algemene ranglijst staat, zoals de posities die DeepSeek V4 Pro op de Intelligence Index haalt of de prijs-prestatieverhouding van Grok 4.6, kan alsnog struikelen over het specifieke werk in uw eigen organisatie. De praktische route is een eigen testset met echte casussen uit uw dossiers, en pas daarna een keuze. Dat kost tijd, maar het scheelt de teleurstelling die veel bedrijven nu ervaren als een pilot niet oplevert wat de demo beloofde.