JEPA-Anything: un modelo del mundo de física a biología

JEPA-Anything: un modelo del mundo de física a biología

Un equipo de investigación ha tomado la arquitectura JEPA, propuesta originalmente por Yann LeCun, y la ha convertido en un modelo del mundo que funciona en siete campos muy distintos. Por el camino, el modelo señaló un posible tratamiento contra el cáncer de hígado, y el equipo lo puso a prueba en el laboratorio.

El proyecto lo lidera PhAI Labs, con colaboradores de Stanford, Oxford y Princeton. El modelo se llama JEPA-Anything.

Un principio en lugar de muchos modelos

Los modelos del mundo intentan predecir cómo cambia un sistema con el tiempo. Ese sistema puede ser un robot, una molécula o el estado de salud de un paciente. Hasta ahora, cada ámbito solía necesitar su propio modelo hecho a medida. El equipo de PhAI Labs quiere demostrar que un único principio común puede abarcarlos todos.

JEPA son las siglas de Joint-Embedding Predictive Architecture (arquitectura predictiva de representaciones conjuntas). Estos modelos no reconstruyen datos en bruto, como los píxeles. Predicen un resumen abstracto de un estado ausente o futuro y pasan por alto los detalles que no importan. Los autores sostienen que la versión estándar tiene un fallo: lo concentra todo en una sola predicción, de modo que los patrones sencillos pueden tapar a los más complejos.

Dividir la predicción

JEPA-Anything descompone el estado predicho en varias partes. Cada parte tiene su propio módulo de predicción. Una restricción adicional obliga a estos módulos a aprender aspectos diferentes de los datos en lugar de aprender todos lo mismo. Después, el modelo combina sus predicciones parciales en una imagen completa.

Los investigadores no le dicen al modelo qué debe representar cada parte. Esos papeles surgen durante el entrenamiento. Lo único que ajustan de un campo a otro es cómo se preparan los datos.

Dónde ayudó y dónde no

El equipo comparó JEPA-Anything con un JEPA estándar que usaba la misma arquitectura, los mismos datos y unas condiciones de entrenamiento idénticas.

  • Sistemas dinámicos: En un entorno simplificado de Pong con intervenciones dirigidas, el error de predicción bajó un 35 %. Con combinaciones de intervenciones que no aparecieron en el entrenamiento, bajó un 13 %.
  • Física y meteorología: Según los autores, el modelo superó a la referencia en diez tareas de prueba de física, robótica y predicción meteorológica. En la ecuación de Burgers, una prueba habitual de dinámica de fluidos, el error se redujo casi a la mitad en un test aparte. A lo largo de 50 pasos de predicción mantuvo la ventaja, aunque esta se redujo a alrededor de un tres por ciento.
  • Simulación molecular: Obtuvo los mejores resultados con agua, cuarzo, paracetamol y benceno, incluso tras 100 pasos.
  • Biología y medicina: Asignó tipos celulares en datos de célula única con más fiabilidad y predijo algo mejor más de 1.000 posibles eventos de enfermedad en datos clínicos.
  • Imágenes y robots: En las tareas de imagen, la diferencia fue pequeña. En la planificación de la locomoción de robots caminantes simulados, ganó en dos de tres entornos y perdió en el tercero.

De las predicciones parciales a una prueba de laboratorio

El resultado más ambicioso procede de la investigación sobre el cáncer de hígado. El equipo examinó las predicciones parciales que un modelo había aprendido a partir de la actividad génica, los niveles de proteínas y cribados CRISPR. El candidato principal combinaba la IL-18, una molécula señalizadora que activa las células inmunitarias, con el bloqueo de CD73, una enzima que los tumores utilizan para frenar las respuestas inmunitarias a su alrededor.

Probaron la combinación en células de cáncer de hígado cocultivadas con células inmunitarias, en organoides y tejido tumoral de tres pacientes en cada caso, y en ratones. En los organoides y las muestras de tejido, la combinación mató más células tumorales que cualquiera de sus componentes por separado, y los linfocitos T y las células NK mostraron una activación más intensa. El estudio no aclara si esto podría convertirse en una terapia real.

En un segundo caso, el modelo se entrenó con órbitas simuladas sin ninguna magnitud física. Los patrones que aprendió se ajustaban mucho a la tercera ley de Kepler: la ley fija el exponente en menos 1,5 y el modelo llegó a menos 1,4991. El equipo solo evaluó una ejecución de entrenamiento, la que tenía el error más bajo.

Los autores añaden una advertencia: que las partes aprendidas estén bien separadas no demuestra que capten relaciones reales de causa y efecto. El código y los modelos están disponibles públicamente.

Nuestro análisis

Este trabajo llega en un momento muy concurrido para los modelos del mundo. Meta lanzó el modelo de vídeo V-JEPA 2 en junio de 2025, LeCun y Randall Balestriero publicaron LeJEPA en noviembre de 2025 y la startup de LeCun, AMI Labs, captó más de mil millones de dólares en marzo de 2026. Los inversores también apuestan fuerte, desde la ronda de General Intuition para modelos del mundo hasta la compra de World Labs por parte de AMD.

Lo que destaca aquí es la amplitud, no una gran cifra aislada. La mayoría de las mejoras son moderadas, algunas son mínimas y los resultados en robótica son irregulares. Eso apunta a que la idea de la descomposición es un ajuste general útil más que un gran avance en un ámbito concreto.

El resultado sobre el cáncer merece una atención prudente. C2S-Scale 27B, de Google Deepmind, ya obtuvo en octubre de 2025 una hipótesis sobre el cáncer confirmada en laboratorio, y su sistema Co-Scientist ya planifica experimentos y maneja equipos de laboratorio. El equipo de JEPA-Anything quiere agentes que propongan y prioricen experimentos y que luego incorporen los resultados, en la línea de los intentos de convertir los modelos de lenguaje en herramientas de laboratorio. Habrá que ver si grupos independientes reproducen estos resultados con el código publicado y si el hallazgo de Kepler se sostiene más allá de una única ejecución elegida a mano.