Biohub bouwt virtuele cel met 1,8 miljard dollar
Biohub, het onderzoeksinstituut van Mark Zuckerberg en Priscilla Chan, krijgt er grote partners bij voor zijn plan om een AI-model van de menselijke cel te bouwen. Samen met het Amerikaanse ministerie van Energie (DOE), de National Institutes of Health (NIH), Google DeepMind, Isomorphic Labs en Meta komt het Virtual Biology Initiative nu uit op ongeveer 1,8 miljard dollar aan geld, data, rekenkracht en technologie. Dat meldden Axios en The Next Web op 7 oktober.
Wie betaalt wat
Biohub startte het initiatief in april met een eigen toezegging van 500 miljoen dollar, verdeeld over vijf jaar. Volgens de aankondiging van Biohub gaat 400 miljoen daarvan naar het op grote schaal verzamelen van data en nieuwe meettechniek, en 100 miljoen naar onderzoek buiten het eigen instituut. Partners van het eerste uur zijn onder meer het Allen Institute, het Broad Institute, het Wellcome Sanger Institute en de Human Cell Atlas. NVIDIA levert rekenkracht en software.
Daar komt nu veel bij. Het DOE investeert ruim 500 miljoen dollar over vijf jaar in labmetingen, modellering en rekenkracht. De NIH brengt datasets en databanken in die eerder met meer dan 500 miljoen dollar aan federaal geld zijn opgebouwd. Google DeepMind, het medicijnbedrijf Isomorphic Labs en Meta leggen samen 300 miljoen dollar op tafel.

Waarom een virtuele cel zoveel data vraagt
Het doel is wat Biohub een “universele virtuele cel” noemt: een model dat voorspelt hoe een cel reageert op bijvoorbeeld een medicijn of een genetische verandering. Onderzoekers kunnen dan eerst digitaal experimenteren en dure labproeven bewaren voor de vragen die echt iets opleveren. “Een nauwkeurig voorspellend model van de biologie kan wetenschappelijke ontdekkingen sterk versnellen”, zegt Alex Rives, hoofd wetenschap bij Biohub, in The Next Web.
Het knelpunt is data. Bestaande celdatasets bevatten honderden miljoenen cellen. Voor een betrouwbaar model zijn er volgens Biohub miljarden nodig, en op termijn biljoenen. De eerste nieuwe dataset moet over ongeveer een jaar klaar zijn. Voor bruikbare voorspellende modellen mikt het consortium op vijf jaar.
Google werkt al langer aan dit soort biologie. DeepMind bracht eerder 9 miljard DNA-varianten in kaart en ontwikkelde een onzichtbaar watermerk voor AI-eiwitten.
Een jaar voorsprong voor de bedrijven
De datasets worden openbaar, maar met een kanttekening. Commerciële financiers krijgen een jaar exclusieve toegang voordat de data vrijkomen. Voor werk dat met overheidsgeld wordt betaald geldt dat embargo niet. Rives is daar open over: “We moeten commerciële partijen een reden geven om mee te doen, en de embargoperiode is die reden”, zei hij tegen Axios.
Voor Meta, DeepMind en Isomorphic is dat jaar veel waard. Wie als eerste modellen kan trainen op nieuwe celdata, heeft een voorsprong in het ontwikkelen van medicijnen. Ook andere AI-labs zoeken die markt op: Anthropic werkt aan Claude Science voor geneesmiddelonderzoek.
Wat betekent dit
Taalmodellen werden goed omdat er een heel internet aan tekst lag om van te leren. Voor biologie bestaat zo’n voorraad nog niet, en dit consortium probeert die te maken. Of een virtuele cel binnen vijf jaar echt betrouwbaar voorspelt, is nog een open vraag. Wel ligt er nu een concrete afspraak over wie de data betaalt, wie ze als eerste mag gebruiken en wanneer de rest van de wetenschap ze krijgt. Hoe snel dit vak beweegt, liet ook Sony zien met een AI die onbekende genverbanden voorspelt.
