Miljarden stromen naar leveranciers van AI-trainingsdata
3 mins read

Miljarden stromen naar leveranciers van AI-trainingsdata

Het grote geld in AI ging de afgelopen jaren vooral naar chips en serverhallen. Op 22 september haalden twee bedrijven fors kapitaal op die iets anders leveren: de data waarmee modellen worden getraind. Snorkel AI kreeg 350 miljoen dollar, Firecrawl 75 miljoen.

Snorkel verdrievoudigt zijn waardering

TechCrunch meldde dat Snorkel AI een Series E van 350 miljoen dollar rondmaakte bij een waardering van 3,5 miljard dollar, met Insight en S32 als leidende investeerders. Zeventien maanden eerder haalde het bedrijf nog 100 miljoen op bij een waardering van 1,3 miljard. Snorkel begon in 2019 als leverancier van software die datalabelen automatiseert, opgericht door onderzoekers uit het Stanford AI Lab. Sinds vorig jaar verkoopt het geen gereedschap meer, maar kant-en-klare datasets en reinforcement learning-omgevingen. Die tak groeide volgens het bedrijf achttienvoudig en draait op een jaaromzet van omgerekend 375 miljoen dollar.

Arts maakt met de hand aantekeningen naast een laptop aan een houten tafel

Firecrawl bouwt een bibliotheek voor agents

SiliconANGLE berichtte diezelfde dag over Firecrawl, dat 75 miljoen dollar ophaalde in een Series B onder leiding van Smash Capital. Altos Ventures, Nexus Venture Partners, Y Combinator, Freestyle en Offline Ventures deden mee. Het bedrijf uit 2024 maakt open source gereedschap dat webpagina’s omzet in gestructureerde data voor AI-agents en telt naar eigen opgave 1,5 miljoen ontwikkelaars en 150.000 bedrijven als gebruiker, waaronder Shopify en Canva. De ronde volgt op een Series A van 20,7 miljoen, een jaar geleden.

Het geld gaat naar Alexandria, een platform dat wetenschappelijke publicaties, code, openbare documenten en actuele data samenbrengt tot een doorzoekbare laag voor modellen en agents. Firecrawl schrijft in de aankondiging dat het uitgevers wil gaan betalen wanneer agents hun materiaal gebruiken, een opvallende toezegging in een markt waar crawlers zelden iets afdragen.

Waarom data nu het knelpunt is

De vraag komt ergens vandaan. Micro1, dat gespecialiseerde experts aan AI-labs uitleent, ging volgens TechCrunch in acht maanden van 100 naar 500 miljoen dollar bruto jaaromzet. Ruwe webtekst levert steeds minder op; wat labs nodig hebben zijn beoordelingen door mensen die het vakgebied echt beheersen, plus omgevingen waarin een model een taak kan oefenen en fouten kan maken. Xiaomi gaf deze week 7.000 van zulke RL-omgevingen vrij, wat aangeeft hoe belangrijk labs die bouwstenen inmiddels vinden.

Dat modellen op papier sterk scoren en in de praktijk stukliepen, bleek eerder al uit onderzoek naar prestaties op echte bedrijfscode. Betere data is een van de weinige knoppen waar labs nog aan kunnen draaien zonder de rekenrekening verder te laten oplopen.

Wat dit betekent

Voor bedrijven die zelf modellen finetunen verschuift de kostenpost. Rekenkracht blijft duur, maar de schaarste zit in domeinkennis die iemand moet vastleggen, en die prijs loopt op. Wie een AI-project plant, kan beter nu al inventariseren welke interne data bruikbaar is dan later een dataleverancier inhuren tegen markttarieven.

Voor de sector zelf is het een tweede financieringsspoor naast de miljardenrondes voor infrastructuur, zoals de lening van 11 miljard die SoftBank ophaalde en de 3,9 miljard voor de AI-fabrieken van Crusoe. Die rondes gaan over gebouwen en stroom. Deze gaan over wat er straks doorheen moet.