Biohub pilote 1,8 milliard de dollars pour l'IA cellulaire

Biohub pilote 1,8 milliard de dollars pour l'IA cellulaire

Un modèle d'IA peut-il apprendre comment une cellule vivante va se comporter avant même que quiconque ne lance l'expérience ? Un groupe d'organisations à but non lucratif, d'entreprises tech et d'agences gouvernementales américaines prévoit désormais de dépenser 1,8 milliard de dollars pour le découvrir. L'objectif : un ensemble de modèles capables de prédire le comportement des cellules, ce qui pourrait accélérer le développement de médicaments.

Biohub, l'organisation à but non lucratif soutenue par Mark Zuckerberg et Priscilla Chan, coordonne le projet, rapporte Reuters. L'argent couvre trois postes : les données, l'équipement de laboratoire et la puissance de calcul.

D'où vient l'argent

Le chiffre de 1,8 milliard de dollars regroupe plusieurs contributions. Certaines avaient déjà été annoncées, d'autres sont nouvelles.

  1. Biohub lui-même. En avril, l'organisation s'est engagée à verser 500 millions de dollars à sa "Virtual Biology Initiative", prévue sur cinq ans. Cet engagement fait désormais partie de l'effort global.

  2. Les géants de la tech et les laboratoires d'IA. Meta, Google DeepMind et Isomorphic Labs apportent ensemble 300 millions de dollars.

  3. Le Département de l'Énergie américain. Le DOE, l'agence fédérale qui gère aussi les laboratoires nationaux du pays, investira plus de 500 millions de dollars sur cinq ans dans les mesures en laboratoire et la puissance de calcul.

  4. Les National Institutes of Health. Les NIH, principale agence américaine de financement de la recherche biomédicale, coordonnent des jeux de données constitués grâce à plus de 500 millions de dollars de financements fédéraux antérieurs. Biohub va standardiser ces jeux de données pour qu'ils puissent servir à entraîner des modèles d'IA.

Ce dernier point compte plus qu'il n'y paraît. Les données biologiques sont souvent collectées par différents laboratoires, dans différents formats, ce qui les rend difficiles à intégrer dans un seul modèle. Transformer des jeux de données publics existants en matériau d'entraînement cohérent est un travail lent et ingrat, et c'est une bonne partie de ce que finance ce projet.

Qui accède aux données, et quand

Les règles d'accès varient selon le financeur. D'après Alex Rives, responsable de la recherche chez Biohub, les bailleurs commerciaux bénéficient d'un an d'accès exclusif aux données qu'ils ont financées. Ensuite, elles deviennent publiques.

Les travaux financés par l'État ne sont pas soumis à cette restriction. Ils seront accessibles sans ce délai d'un an.

Le calendrier n'est pas court. Le premier jeu de données devrait être prêt dans environ un an.

Biohub n'est pas le seul à s'intéresser à la biologie

Le projet de Biohub fait partie de plusieurs initiatives récentes d'acteurs de l'IA pour s'implanter dans les sciences du vivant. Anthropic a créé son propre laboratoire de biologie consacré au développement de médicaments assisté par l'IA, et d'autres projets cherchent à transformer des modèles comme Claude en véritables outils de laboratoire. De son côté, la OpenAI Foundation consacre plus de 125 millions de dollars à des jeux de données biologiques et médicales.

Le point commun, ce sont les données. Les laboratoires qui veulent construire des modèles pour la biologie ont besoin de mesures massives et bien structurées pour les entraîner, et celles-ci coûtent cher à produire.

Notre analyse

Le plus révélateur dans cet accord, ce n'est pas le montant affiché, mais sa structure. Des entreprises tech, une organisation à but non lucratif et deux agences fédérales mettent leur argent en commun pour des jeux de données partagés, au lieu de construire chacune les siens. Cela suggère qu'en biologie, ce sont les données d'entraînement brutes, plus que la conception des modèles, qui sont perçues comme le goulot d'étranglement.

Cela s'inscrit aussi dans une tendance plus large : des chercheurs qui tentent de bâtir des modèles généraux des systèmes physiques. Nous avons déjà parlé des tentatives de créer un modèle du monde unique couvrant la physique et la biologie, ainsi que de projets qui ouvrent de vastes archives scientifiques à l'entraînement de modèles. La prédiction du comportement cellulaire est une prochaine cible logique.

Le délai d'exclusivité d'un an mérite qu'on s'y attarde. Il donne une longueur d'avance aux financeurs commerciaux, tandis que les données financées par l'État restent ouvertes. Il faudra voir quelle part du total se retrouve, en pratique, derrière ce délai, et si le premier jeu de données arrive bien dans les temps, d'ici environ un an. Ce n'est qu'alors qu'on saura si les modèles prédictifs de la cellule apportent de vrais progrès au développement de médicaments ou s'ils restent une piste de recherche prometteuse.