OpenAI publica 372 resultados matemáticos de IA en GitHub

OpenAI publica 372 resultados matemáticos de IA en GitHub

OpenAI ha publicado 372 nuevos resultados matemáticos generados por uno de sus modelos internos de frontera. No los ha enviado a revistas académicas. Los ha colgado todos en un repositorio público de GitHub, junto con registros de revisiones y referencias. Según la compañía, cada resultado resuelve un problema abierto o supone un avance sustancial hacia su resolución.

La colección abarca un abanico amplio. Algunos resultados mejoran algoritmos informáticos importantes. Otros guardan relación con la hipótesis de Riemann, uno de los problemas sin resolver más conocidos de las matemáticas. Según OpenAI, el mismo modelo ya ha generado una solución a un problema de Navier-Stokes, y esa solución lleva semanas sometida a revisión formal.

Una instrucción, un agente, tres horas

Lo que más llama la atención es el método de producción. OpenAI asegura que casi todos los resultados salieron de una única instrucción dada a un único agente de IA, aunque algunos necesitaron más de un intento. De media, cada resultado consumió unas tres horas de cómputo de ChatGPT Pro Thinking.

El trabajo sobre Navier-Stokes fue muy distinto. Hizo falta un enjambre de 10.000 agentes y millones de dólares en cómputo. El nuevo lote sugiere que el coste por resultado ha caído en picado, al menos en los problemas que OpenAI eligió abordar.

OpenAI también ha publicado notas sobre su metodología:

  • resúmenes del proceso de razonamiento del modelo
  • estadísticas sobre cuántos problemas intentó resolver el modelo
  • estimaciones de los costes de cómputo

Lean como atajo para la revisión

Muchas de las demostraciones vienen acompañadas de formalizaciones en Lean, un lenguaje de programación diseñado para demostraciones matemáticas que una máquina puede verificar. OpenAI afirma que habrá más formalizaciones.

El motivo es práctico. Cientos de demostraciones generadas por IA podrían desbordar fácilmente la capacidad de los matemáticos para revisarlas a mano. Otros campos se han topado con problemas parecidos. Google, por ejemplo, suspendió un programa de recompensas por errores de código abierto tras recibir una avalancha de informes generados por IA. Las demostraciones verificables por máquina son el intento de OpenAI de evitar ese tipo de cuello de botella en las matemáticas.

Saltarse las revistas

Elegir GitHub en lugar de revistas con revisión por pares es toda una declaración. Implica que la publicación académica tradicional es demasiado lenta para este volumen de resultados potencialmente nuevos.

OpenAI consultó al Grupo Asesor sobre Matemáticas e Inteligencia Artificial del Institute for Advanced Study (IAS), el centro de investigación de Princeton. Entre sus miembros está el ganador de la Medalla Fields Timothy Gowers. OpenAI solo siguió a medias las recomendaciones públicas del grupo. No publicó ninguna de sus instrucciones y solo compartió los costes medios de cómputo, no las cifras de cada problema.

La compañía también fijó un límite antes de que empezara la consulta. Los matemáticos podían opinar sobre cómo se comunicaban los resultados, pero no sobre si se producían ni a qué ritmo.

OpenAI dice que financiará talleres y congresos centrados en comprender los resultados producidos por IA. Reconoce que sus referencias y su presentación necesitan mejorar. También afirma que está preparando un lanzamiento responsable del modelo para "dotar directamente a los científicos de capacidades de vanguardia".

Correcto no es lo mismo que relevante

Lean puede confirmar que una demostración es lógicamente correcta. No puede decir si un resultado es original ni si tiene importancia matemática. OpenAI apuesta a que sus resultados amplían los límites del conocimiento humano. Todavía no está claro si los matemáticos están de acuerdo, y las primeras reacciones van del entusiasmo a la frustración.

Algunas de las figuras más destacadas del campo ya han expresado su preocupación. En una carta abierta titulada "Un grave desajuste de la IA en las matemáticas", 25 ganadores de la Medalla Fields describieron una profunda desconexión entre los objetivos de la industria de la IA y los de las matemáticas. A su juicio, resolver problemas es solo una herramienta y un indicador indirecto. El verdadero objetivo es la comprensión conceptual y la intuición. Sostenían que producir en masa enunciados verdaderos podría arrasar terreno fértil en lugar de generar ideas nuevas, y que el daño se extendería a otros campos.

Gowers ha advertido de que, en un plazo de una o dos décadas, la literatura matemática podría crecer enormemente sin que quede ninguna comunidad humana que la entienda de verdad. Terence Tao, también ganador de la Medalla Fields, ha dicho que la formación de los jóvenes matemáticos debería poner el acento en la dimensión humana de la disciplina y limitar estrictamente el uso de herramientas de IA, para que sobrevivan el aprendizaje y la comprensión reales.

Nuestro análisis

Este lanzamiento parece ir tanto del proceso como de las matemáticas. Un solo agente trabajando tres horas por problema cambia la economía de la producción de demostraciones. Si ese coste se mantiene, la producción seguirá creciendo más rápido de lo que los revisores humanos pueden asumir. Lean ayuda con una parte del problema, la corrección. Las preguntas más difíciles son si un resultado es relevante y si es original, y esas siguen dependiendo de personas que ya van al límite.

Las reglas del juego también merecen atención. OpenAI pidió consejo a matemáticos de primer nivel, pero no les dejó influir en si se hacía el trabajo ni a qué velocidad. Además, se guardó sus instrucciones y los costes por problema. Eso deja a la comunidad investigadora reaccionando al lanzamiento en lugar de darle forma. Una tensión similar está apareciendo en otros ámbitos académicos, como mostró nuestra cobertura de un informe del MIT sobre la erosión de la confianza del profesorado.

Hay varias cosas que conviene seguir de cerca:

  1. Si matemáticos independientes confirman que algunos de los 372 resultados son realmente nuevos y significativos.
  2. Cómo concluye la revisión sobre Navier-Stokes.
  3. Si el lanzamiento del modelo prometido por OpenAI da a los investigadores una herramienta que puedan dirigir ellos mismos, como pretenden entornos como BootLoops con otros modelos.

Si el lanzamiento solo sirve para engordar un montón de demostraciones que nadie lee, la advertencia de los medallistas Fields podría acabar siendo la predicción más acertada.