BootLoops : un outil open source qui met Claude au labo
Faire résoudre un problème à un modèle d'IA, ce n'est pas la même chose que lui faire mener des recherches qui comptent. C'est la principale leçon que tire Matthew Schwartz, physicien à Harvard, dans une tribune publiée par Anthropic. Schwartz est par ailleurs actuellement chercheur invité dans l'entreprise.
Sa démarche a changé lorsqu'il a cessé de considérer Claude comme le remplaçant d'un scientifique humain. Il s'est plutôt mis en quête de ce qu'il appelle des "problèmes taillés pour Claude" : des tâches adaptées aux points forts des modèles d'IA actuels. Le résultat s'appelle BootLoops, un cadre logiciel open source pour les calculs scientifiques exacts. Son code est publié sur GitHub.
Combler les vides entre les disciplines
Schwartz explique l'idée à l'aide de l'"enveloppe convexe", une notion de géométrie. Le savoir humain est inégal. Chaque discipline avance dans sa propre direction, et l'espace qui les sépare reste souvent inexploré. Un laboratoire peut consacrer 20 ans à un même ensemble de gènes avec une seule méthode, sans jamais toucher aux gènes voisins ni à d'autres approches.
BootLoops est conçu pour travailler dans ces interstices, en reliant des résultats situés aux frontières irrégulières de différents domaines. Selon Schwartz, Claude s'est servi de l'outil pour établir des liens entre la physique des particules, l'écologie, la génétique des populations, l'économie et la linguistique. Mais les résultats ne devenaient souvent scientifiquement utiles qu'après l'intervention de spécialistes du domaine, qui fixaient le cap.
36 manuscrits en trois mois
Les chiffres sont impressionnants. En trois mois, Schwartz et 19 coauteurs ont produit 36 manuscrits couvrant 18 domaines.
Tout a commencé en physique des particules, avec les amplitudes de diffusion et les intégrales elliptiques. En quelques semaines, Claude avait calculé 30 intégrales avec BootLoops. Quinze reproduisaient des résultats connus. Les quinze autres n'avaient jamais été calculées.
L'équipe s'est ensuite diversifiée :
- Écologie : Claude a résolu une équation vieille de 20 ans issue de la théorie neutre de la biodiversité, jusque-là impossible à calculer à grande échelle. Appliquée à des données réelles, elle a montré que la composition des espèces d'arbres sur l'île de Barro Colorado, dans le canal de Panama, évolue 4,5 fois plus vite que ce que la théorie autorise. L'écologue James O'Dwyer a ensuite aidé à en tirer un meilleur modèle prédictif.
- Génétique des populations : L'équipe a analysé 5,7 milliards de paires de mutations issues du projet 1000 Genomes et a mis en évidence un mécanisme appelé conversion génique.
- Économie : Un éditeur de données fondé sur l'IA pour les revues d'économie a vérifié automatiquement 4 452 dossiers de réplication. Ces travaux ont été publiés sous forme de NBER Working Paper.
- Linguistique : Avec trois linguistes, l'équipe a constitué une base de données sur l'accent tonique couvrant 6 072 langues.
Formation et financement remis en question
Pour Schwartz, la vitesse des changements rend toute planification à long terme quasi impossible. Pourquoi demander une subvention sur trois ans pour financer un calcul qu'un modèle d'IA pourrait boucler en une nuit ?
Il s'interroge aussi sur la manière de former les doctorants. Dans certains domaines, comme l'informatique, il juge le bouleversement inquiétant. Il y a deux ans, il aurait qualifié un cours de "Python for Engineers" d'"indispensable". Aujourd'hui, il le considère comme "superflu", puisque Claude peut faire ce travail. Concevoir des modèles d'apprentissage automatique pour étudier des phénomènes physiques est une autre tâche que l'IA est, selon lui, en train de reprendre.
Les limites du modèle
Schwartz ne mâche pas ses mots sur les faiblesses. Claude a tendance à crier victoire trop tôt. Une formule comme "terminé, avec un astérisque" signifie souvent que le travail n'est pas terminé du tout. Le modèle évalue mal la durée des tâches et privilégie le calcul en force brute plutôt que des solutions plus élégantes. Les vérifications automatiques ne sont pas fiables, et Claude peut tirer des conclusions fausses de calculs justes.
Il glisse aussi vers de vieux débats abondamment cités plutôt que vers des questions nouvelles. Et les projets étaient "gourmands en calcul et en tokens", souligne-t-il. Son conseil est simple : tout vérifier soi-même.
Notre analyse
BootLoops offre un contrepoids utile aux habituels gros titres sur l'IA qui résout de grands problèmes mathématiques. Le bilan de Schwartz suggère qu'à court terme, la valeur se trouve dans un travail moins prestigieux : calculer ce qui était trop fastidieux à calculer, et relier des domaines qui dialoguent rarement entre eux.
Les mises en garde méritent autant d'attention que les résultats. Un modèle qui fait juste en maths mais se trompe dans sa conclusion, c'est un schéma bien connu. Nous avons observé des décalages similaires avec des agents qui construisent des scènes qu'ils ne savent pas évaluer et avec une comptabilité par IA qui a encore besoin de supervision. Ici, l'expert dans la boucle n'a rien de facultatif.
Reste à voir si d'autres groupes de recherche adopteront cet outil open source, et si les 36 manuscrits résisteront à l'évaluation par les pairs. Le coût du calcul et des tokens pourrait aussi déterminer dans quelle mesure cette approche se diffusera au-delà des laboratoires bien financés.
