micro1 wil een miljard dollar betalen voor bedrijfsdata
Het Amerikaanse datalab micro1 wil een miljard dollar uitgeven aan iets wat de meeste bedrijven als bijzaak zien: hun interne documentatie. Werkinstructies, kennisbanken, CRM-gegevens en projectdossiers moeten AI-agents leren hoe echt werk eruitziet. Het bedrijf maakte het plan op 9 oktober bekend via een persbericht op Business Wire.
Wat micro1 precies koopt
Volgens The Next Web loopt de aankoop via een programma met de naam Company Data Partnerships. Het geld komt van Citi en investeerder Hercules Capital en moet binnen twaalf maanden zijn besteed. micro1 zoekt standaardprocedures, interne documenten, kwaliteitsprocessen, vastgelegde beslissingen van teams en menselijke feedback op AI-uitvoer.
De vergoeding hangt af van kwaliteit en uniciteit. Een gewoon partnerschap levert meer dan 100.000 dollar op, grote datasets of doorlopend werk met meerdere teams meer dan 500.000 dollar. Voor zeer unieke, eigen data betaalt micro1 meer dan een miljoen. De doelgroep is beperkt: bedrijven met minimaal dertig medewerkers en goed vastgelegde processen, eerst in de Verenigde Staten en daarna in andere westerse markten. Het materiaal moet Engelstalig zijn, dus Nederlandse bedrijven met Nederlandse documentatie vallen voorlopig buiten de boot.

Oefenterrein voor AI-agents
micro1 bouwt met de data zogeheten reinforcement learning-omgevingen: nagebootste werkplekken waarin een model leert taken af te ronden en beslissingen te nemen zoals een team dat in de praktijk doet. Dat soort omgevingen is gewild. Xiaomi gaf eerder 7.000 RL-omgevingen vrij en er gaan al miljarden naar leveranciers van trainingsdata. Openbare internetteksten zijn grotendeels opgebruikt, terwijl de manier waarop een klantenservice of inkoopafdeling echt werkt nergens online staat.
Het bedrijf is agressief. In september bood micro1 volgens The Next Web 12,5 miljoen dollar voor de klantgegevens van het failliete Spirit Airlines. De door de rechtbank aangestelde privacytoezichthouder gaf de voorkeur aan een bod van 10 miljoen dollar van Google.
Wie mag die data eigenlijk verkopen?
micro1 zegt de data te de-identificeren, persoonsgegevens te verwijderen “waar relevant” en datasets soms synthetisch te herschrijven. Bedrijven blijven eigenaar en mogen voorbeelden inzien. Analist Rajesh Beri is daar in zijn nieuwsbrief The Daily Brief sceptisch over. Een bestand bezitten is iets anders dan het recht hebben om de inhoud door te verkopen, schrijft hij. CRM-records bevatten informatie van klanten, en contracten met die klanten beperken het gebruik vaak. Onder de AVG moet data gebruikt worden voor het doel waarvoor ze is verzameld; commerciële AI-training is een nieuw doel.
Beri wijst ook op heridentificatie. Projectdossiers bevatten klantnamen, regio’s en managers, genoeg om geanonimiseerde gegevens terug te herleiden. Hij haalt onderzoek aan waarin 99,98 procent van de Amerikanen op basis van een handvol demografische kenmerken correct werd teruggevonden. Kennisbanken bevatten verder vaak ingekochte analistenrapporten waarvan de licentie doorverkoop verbiedt.
Wat betekent dit
De prijs van AI-training verschuift van rekenkracht naar praktijkkennis. Interne processen die jarenlang als administratieve last golden, hebben opeens een prijskaartje. Voor bedrijven die het aanbod overwegen, ook straks in Europa, is de juridische toets het lastige deel: wie heeft de data aangeleverd en onder welke voorwaarden? Dat agents met bedrijfsgegevens fouten kunnen maken, liet Spanje al zien met het eerste datalek door een AI-agent. En hoe agents zich gedragen meet Arena sinds kort met een eigen index voor ongehoorzame agents. Wie zijn documentatie verkoopt, levert straks mee aan de training van die systemen.
