Biohub leidt AI-project van $1,8 miljard voor celgedrag
Kan een AI-model leren hoe een levende cel zich gedraagt voordat iemand het experiment heeft uitgevoerd? Een groep non-profitorganisaties, techbedrijven en Amerikaanse overheidsinstanties wil 1,8 miljard dollar uitgeven om daarachter te komen. Het doel is een reeks modellen die celgedrag voorspellen, wat de ontwikkeling van geneesmiddelen kan versnellen.
Biohub, de non-profitorganisatie van Mark Zuckerberg en Priscilla Chan, coordineert het initiatief, meldt Reuters. Het geld gaat naar drie dingen: data, laboratoriumapparatuur en rekenkracht.
Waar het geld vandaan komt
Het bedrag van 1,8 miljard dollar is een optelsom van verschillende bijdragen. Een deel was al aangekondigd, een deel is nieuw.
-
Biohub zelf. In april zegde de organisatie 500 miljoen dollar toe aan haar vijfjarige "Virtual Biology Initiative". Die toezegging valt nu onder het grotere project.
-
Big Tech en AI-labs. Meta, Google DeepMind en Isomorphic Labs leggen samen 300 miljoen dollar in.
-
Het Amerikaanse ministerie van Energie. Het DOE, de federale instantie die ook de nationale laboratoria van het land beheert, investeert in vijf jaar tijd meer dan 500 miljoen dollar in labmetingen en rekenkracht.
-
De National Institutes of Health. De NIH, de belangrijkste Amerikaanse financier van biomedisch onderzoek, coordineert datasets die zijn opgebouwd met meer dan 500 miljoen dollar aan eerdere federale financiering. Biohub zal deze datasets standaardiseren, zodat ze bruikbaar worden voor het trainen van AI-modellen.
Dat laatste punt is belangrijker dan het misschien lijkt. Biologische data wordt vaak door verschillende labs in verschillende formaten verzameld, waardoor het lastig is om alles in een enkel model te stoppen. Bestaande openbare datasets omzetten in consistent trainingsmateriaal is traag en weinig glamoureus werk, en het is een groot deel van waar dit project voor betaalt.
Wie krijgt de data, en wanneer
De toegangsregels verschillen per financier. Volgens Alex Rives, onderzoeksleider bij Biohub, krijgen commerciele geldschieters een jaar lang exclusieve toegang tot de data waarvoor ze hebben betaald. Daarna wordt die openbaar.
Voor werk dat door de overheid is gefinancierd geldt die beperking niet. Dat komt beschikbaar zonder de wachttijd van een jaar.
Snel gaat het niet. De eerste dataset moet over ongeveer een jaar klaar zijn.
Niet het enige AI-lab dat naar biologie kijkt
Het project van Biohub is een van meerdere recente pogingen van AI-spelers om voet aan de grond te krijgen in de life sciences. Anthropic heeft een eigen biologielab opgezet voor AI-gedreven medicijnontwikkeling, en er zijn ook initiatieven om modellen als Claude om te vormen tot praktische labtools. De OpenAI Foundation steekt op haar beurt meer dan 125 miljoen dollar in biologische en medische datasets.
De rode draad is data. Labs die modellen voor de biologie willen bouwen, hebben grote, goed gestructureerde metingen nodig om op te trainen, en die zijn duur om te produceren.
Het grotere plaatje
Het meest veelzeggende aan deze deal is niet het bedrag, maar de opzet. Techbedrijven, een non-profitorganisatie en twee federale instanties leggen geld bij elkaar voor gedeelde datasets, in plaats van dat ieder zijn eigen datasets bouwt. Dat wijst erop dat in de biologie ruwe trainingsdata eerder als knelpunt wordt gezien dan het ontwerp van de modellen.
Het past ook in een breder patroon van onderzoekers die algemene modellen van fysieke systemen proberen te bouwen. We schreven eerder over pogingen tot een enkel wereldmodel dat natuurkunde en biologie omvat, en over projecten die grote wetenschappelijke archieven openstellen voor het trainen van modellen. Het voorspellen van cellen is een logische volgende stap.
De exclusiviteitsperiode van een jaar verdient aandacht. Die geeft commerciele financiers een voorsprong, terwijl door de overheid gefinancierde data openbaar blijft. Het is de moeite waard om te volgen hoeveel van het totaal in de praktijk achter die periode verdwijnt, en of de eerste dataset over ongeveer een jaar volgens planning verschijnt. Pas dan wordt duidelijk of voorspellende celmodellen echte winst opleveren voor de ontwikkeling van geneesmiddelen, of een veelbelovende onderzoeksrichting blijven.
