Preuves mathématiques d'OpenAI : 372 résultats sur GitHub
OpenAI a publié 372 nouveaux résultats mathématiques produits par l'un de ses modèles internes de pointe. L'entreprise ne les a pas soumis à des revues scientifiques. Elle les a tous mis en ligne dans un dépôt GitHub public, accompagnés des historiques de révision et des références. Selon elle, chaque résultat résout un problème ouvert ou fait nettement progresser sa résolution.
L'ensemble couvre un large éventail. Certains résultats améliorent des algorithmes informatiques majeurs. D'autres touchent à l'hypothèse de Riemann, l'un des problèmes non résolus les plus célèbres des mathématiques. D'après OpenAI, le même modèle a déjà produit une solution à un problème lié aux équations de Navier-Stokes, et cette solution fait l'objet d'un examen formel depuis plusieurs semaines.
Une requête, un agent, trois heures
C'est surtout la méthode de production qui retient l'attention. OpenAI affirme que presque tous les résultats sont issus d'une seule requête adressée à un seul agent d'IA, même si certains ont nécessité plusieurs tentatives. En moyenne, chaque résultat a mobilisé environ trois heures de calcul de ChatGPT Pro Thinking.
Le travail sur Navier-Stokes était d'une tout autre ampleur. Il avait fallu un essaim de 10 000 agents et des millions de dollars de puissance de calcul. Cette nouvelle série laisse penser que le coût par résultat a fortement baissé, du moins pour les problèmes qu'OpenAI a choisi de traiter.
OpenAI a également publié des notes sur sa méthodologie :
- des résumés du raisonnement du modèle
- des statistiques sur le nombre de problèmes abordés par le modèle
- des estimations des coûts de calcul
Lean pour accélérer la vérification
Une bonne partie des preuves s'accompagne de formalisations en Lean, un langage de programmation conçu pour écrire des preuves mathématiques vérifiables par une machine. OpenAI annonce que d'autres formalisations suivront.
La raison est pratique. Des centaines de preuves générées par IA pourraient facilement dépasser la capacité des mathématiciens à les vérifier à la main. D'autres domaines se sont heurtés à des difficultés comparables. Google, par exemple, a suspendu un programme de primes aux bugs open source après avoir été submergé de signalements générés par IA. Avec des preuves vérifiables par machine, OpenAI tente d'éviter ce type d'engorgement en mathématiques.
Les revues mises de côté
Préférer GitHub aux revues à comité de lecture n'a rien d'anodin. Ce choix sous-entend que l'édition scientifique traditionnelle est trop lente pour absorber un tel volume de résultats potentiellement inédits.
OpenAI a consulté l'Advisory Group on Mathematics and Artificial Intelligence de l'Institute for Advanced Study (IAS), le centre de recherche de Princeton. Le lauréat de la médaille Fields Timothy Gowers en fait partie. OpenAI n'a suivi que de loin les recommandations publiques du groupe. L'entreprise n'a publié aucune de ses requêtes et n'a communiqué que des coûts de calcul moyens, sans chiffres par problème.
Elle avait aussi fixé une limite avant même le début de la consultation. Les mathématiciens pouvaient donner leur avis sur la manière de présenter les résultats, mais pas sur l'opportunité de les produire ni sur le rythme de production.
OpenAI dit qu'elle financera des ateliers et des conférences consacrés à la compréhension des résultats produits par l'IA. Elle reconnaît que ses références et sa présentation doivent être améliorées. Elle indique aussi préparer une mise à disposition responsable du modèle afin de "donner directement aux scientifiques des capacités de pointe".
Correct ne veut pas dire pertinent
Lean peut confirmer qu'une preuve est logiquement correcte. Il ne peut pas dire si un résultat est original ni s'il a une réelle portée mathématique. OpenAI parie que ses résultats repoussent les frontières du savoir humain. Rien ne dit encore que les mathématiciens partagent cet avis, et les premières réactions vont de l'enthousiasme à l'agacement.
Certaines des figures les plus en vue de la discipline ont déjà exprimé leurs inquiétudes. Dans une lettre ouverte intitulée "A Severe Misalignment of AI in Mathematics", 25 lauréats de la médaille Fields décrivent un profond décalage entre les objectifs de l'industrie de l'IA et ceux des mathématiques. Selon eux, résoudre des problèmes n'est qu'un outil et un indicateur indirect. Le véritable but, c'est la compréhension conceptuelle et l'intuition. Ils estiment que produire en masse des énoncés vrais pourrait stériliser un terrain fertile au lieu de faire naître des idées nouvelles, et que les dégâts s'étendraient à d'autres disciplines.
Timothy Gowers a prévenu que d'ici dix à vingt ans, la littérature mathématique pourrait enfler considérablement sans qu'il reste une communauté humaine capable de vraiment la comprendre. Terence Tao, lui aussi lauréat de la médaille Fields, a déclaré que la formation des jeunes mathématiciens devait mettre l'accent sur la dimension humaine de la discipline et limiter strictement le recours aux outils d'IA, pour préserver un véritable apprentissage et une vraie compréhension.
Notre analyse
Cette publication semble porter autant sur la méthode que sur les mathématiques. Un seul agent tournant trois heures par problème change l'économie de la production de preuves. Si ce coût se confirme, la production continuera de croître plus vite que ce que les relecteurs humains peuvent suivre. Lean règle une partie du problème, celle de l'exactitude. Les questions les plus difficiles restent de savoir si un résultat est pertinent et s'il est original, et elles reposent toujours sur des personnes déjà débordées.
Les règles du jeu méritent aussi qu'on s'y arrête. OpenAI a sollicité l'avis de mathématiciens de premier plan sans leur laisser la moindre prise sur l'opportunité ou le rythme du travail. L'entreprise a également gardé pour elle ses requêtes et ses coûts par problème. Résultat, la communauté scientifique réagit à cette publication au lieu de la façonner. Des tensions similaires apparaissent ailleurs dans le monde universitaire, comme l'a montré notre article sur un rapport du MIT consacré à l'érosion de la confiance des enseignants.
Plusieurs points seront à surveiller :
- Si des mathématiciens indépendants confirment qu'une partie des 372 résultats est réellement nouvelle et significative.
- L'issue de l'examen des travaux sur Navier-Stokes.
- Si le modèle promis par OpenAI offrira aux chercheurs un outil qu'ils pourront piloter eux-mêmes, comme le visent des environnements tels que BootLoops avec d'autres modèles.
Si cette publication ne fait que grossir une pile de preuves que personne ne lit, l'avertissement des médaillés Fields pourrait bien se révéler le pronostic le plus juste.
