Biohub lidera 1.800 millones de dólares para IA celular

Biohub lidera 1.800 millones de dólares para IA celular

¿Puede un modelo de IA aprender cómo se comportará una célula viva antes de que nadie haga el experimento? Un grupo de organizaciones sin ánimo de lucro, empresas tecnológicas y agencias del Gobierno estadounidense va a gastar 1.800 millones de dólares para averiguarlo. El objetivo es un conjunto de modelos que predigan el comportamiento celular, algo que podría acelerar el desarrollo de fármacos.

Según Reuters, Biohub, la organización sin ánimo de lucro respaldada por Mark Zuckerberg y Priscilla Chan, coordina la iniciativa. El dinero cubre tres cosas: datos, equipamiento de laboratorio y capacidad de cómputo.

De dónde sale el dinero

La cifra de 1.800 millones de dólares suma varias aportaciones. Algunas ya se habían anunciado y otras son nuevas.

  1. La propia Biohub. En abril, la organización comprometió 500 millones de dólares para su "Virtual Biology Initiative", un programa a cinco años. Ese compromiso forma ahora parte de la iniciativa general.

  2. Grandes tecnológicas y laboratorios de IA. Meta, Google DeepMind e Isomorphic Labs aportan 300 millones de dólares entre las tres.

  3. El Departamento de Energía de EE. UU. El DOE, la agencia federal que también gestiona los laboratorios nacionales del país, invertirá más de 500 millones de dólares en cinco años en mediciones de laboratorio y cómputo.

  4. Los Institutos Nacionales de Salud. Los NIH, la principal agencia estadounidense de financiación de la investigación biomédica, coordinan conjuntos de datos creados con más de 500 millones de dólares de financiación federal anterior. Biohub los estandarizará para que puedan usarse en el entrenamiento de modelos de IA.

Este último punto importa más de lo que parece. Los datos biológicos suelen recogerlos laboratorios distintos en formatos distintos, así que cuesta integrarlos en un único modelo. Convertir conjuntos de datos públicos ya existentes en material de entrenamiento coherente es un trabajo lento y poco vistoso, y es una parte importante de lo que financia este proyecto.

Quién accede a los datos y cuándo

Las reglas de acceso dependen de quién financie. Según Alex Rives, responsable de investigación de Biohub, los patrocinadores comerciales tendrán un año de acceso exclusivo a los datos que hayan pagado. Después, se harán públicos.

El trabajo financiado por el Gobierno no tiene esa restricción. Estará disponible sin ese plazo de un año.

Los plazos no son cortos. El primer conjunto de datos debería estar listo en aproximadamente un año.

No es el único actor de la IA que mira a la biología

El proyecto de Biohub es uno de varios intentos recientes de empresas de IA por entrar en las ciencias de la vida. Anthropic ha montado su propio laboratorio de biología para el desarrollo de fármacos con IA, y también hay iniciativas para convertir modelos como Claude en herramientas prácticas de laboratorio. La OpenAI Foundation, por su parte, destina más de 125 millones de dólares a conjuntos de datos biológicos y médicos.

El denominador común son los datos. Los laboratorios que quieren construir modelos para biología necesitan mediciones abundantes y bien estructuradas con las que entrenarlos, y producirlas es caro.

La visión de conjunto

Lo más revelador de este acuerdo no es la cifra que acapara los titulares, sino su estructura. Empresas tecnológicas, una organización sin ánimo de lucro y dos agencias federales ponen dinero en común para crear conjuntos de datos compartidos en lugar de que cada uno construya los suyos. Esto sugiere que, en biología, el cuello de botella se ve más en los datos de entrenamiento en bruto que en el diseño de los modelos.

También encaja en una tendencia más amplia: investigadores que intentan construir modelos generales de sistemas físicos. Hemos hablado de intentos de crear un único modelo del mundo que abarque de la física a la biología, así como de proyectos que abren grandes archivos científicos para entrenar modelos. Predecir el comportamiento de las células es el siguiente paso lógico.

El plazo de exclusividad de un año merece atención. Da ventaja a los financiadores comerciales, mientras que los datos financiados con dinero público siguen abiertos. Habrá que ver qué parte del total acaba en la práctica tras esa exclusividad y si el primer conjunto de datos llega a tiempo, en aproximadamente un año. Solo entonces quedará claro si los modelos predictivos de células aportan avances reales al desarrollo de fármacos o se quedan en una línea de investigación prometedora.