Modèle lunaire NASA-IBM : 17 ans de données sur la Lune
La NASA et IBM Research ont publié un modèle d'IA open source conçu pour étudier la Lune. Le NASA-IBM Lunar Foundation Model a été développé avec plusieurs établissements universitaires, et les deux organisations le présentent comme l'un des premiers modèles de fondation ouverts dédiés à la science lunaire. C'est dans la prédiction des dépôts de glace polaires et la détection de cratères qu'il se montre le plus performant.
Kevin Murphy, responsable des données scientifiques de la NASA, a posé le problème sans détour. La NASA a constitué au fil des décennies une immense archive scientifique sur la Lune, a-t-il expliqué, mais collecter des données ne représente que la moitié du travail. Encore faut-il que les scientifiques puissent les exploiter.
Pourquoi un modèle de fondation
Les algorithmes spécialisés sont entraînés pour une seule tâche. Un modèle de fondation, lui, est préentraîné sur de grandes quantités de données non annotées, puis peut être adapté à de nouvelles tâches avec seulement quelques exemples annotés. La recherche lunaire dispose de très nombreuses données d'observation mais de très peu d'annotations, et l'équipe y voit donc le principal atout de cette approche.
Les données d'entraînement
Le modèle a été entraîné de zéro sur SomBench, que l'équipe décrit comme le plus grand corpus lunaire multimodal co-enregistré à ce jour. Il rassemble près de 2 millions de lots de tuiles couvrant 11 modalités à deux échelles spatiales :
- Environ 1 million d'images haute résolution de la Narrow Angle Camera (NAC), à environ 1 mètre par pixel
- Un peu moins de 964 000 images multispectrales de la Wide Angle Camera, à 100 mètres par pixel
L'essentiel des données provient de 17 ans d'observations du Lunar Reconnaissance Orbiter (LRO) de la NASA. Selon l'agence, le volume de données de LRO dépasse celui de toutes ses autres missions planétaires réunies. L'équipe y a ajouté des données gravimétriques de GRAIL, des données sur l'hydrogène de Lunar Prospector et des données minéralogiques de Kaguya/SELENE, une sonde exploitée par l'agence spatiale japonaise JAXA.
Résultat : plus de 30 couches de données alignées spatialement, issues de neuf instruments et de quatre missions. Pour éviter que des données de test ne se retrouvent dans l'entraînement, le corpus a été découpé géographiquement par zone cartographique plutôt qu'en mélangeant les tuiles au hasard.
Indiquer la lumière au modèle
L'architecture s'appuie sur TerraMind, un modèle multimodal d'observation de la Terre, mais la version lunaire a été entraînée de zéro et non simplement affinée. Un choix de conception se démarque. Sur la Lune, la géométrie de l'éclairage influence davantage l'aspect de la surface que ses propriétés réelles. Plutôt que de laisser le modèle le déduire à partir des pixels bruts, l'équipe lui fournit donc explicitement les angles d'éclairage, la position du Soleil et l'étendue de chaque tuile.
Le modèle apprend aussi à partir d'images fines et grossières au cours d'un seul et même entraînement. Une technique appelée FlexiViT permet au même modèle entraîné de traiter des tailles de patchs d'image différentes sans réentraînement.
Là où il l'emporte, et là où il ne l'emporte pas
L'équipe a testé le modèle sur la détection de cratères aux échelles de 100 mètres et de 1 mètre, sur la prédiction de la glace polaire et sur la segmentation des Irregular Mare Patches (IMP). Il s'agit de formations volcaniques récentes qui remettent en cause les chronologies admises du refroidissement de la Lune. D'après le rapport technique, le modèle préentraîné a égalé ou dépassé les références courantes ainsi qu'un modèle témoin identique, initialisé aléatoirement, sur toutes les tâches.
C'est la prédiction de la glace qui affiche le gain le plus net. Les régions polaires plongées dans une ombre permanente peuvent conserver de la glace d'eau pendant des milliards d'années et sont considérées comme une source potentielle d'eau, d'oxygène et de carburant pour fusées. IBM affirme que le modèle a réduit l'erreur de prédiction de jusqu'à 22 % par rapport à la meilleure référence, SwinV2-B. Pour la détection de cratères à grande échelle, il a battu SwinV2-B de près de 19 % tout en étant entraîné sur seulement la moitié des données.
Ailleurs, le tableau est moins net. Même le modèle témoin non préentraîné a battu cinq des sept références sur la prédiction de la glace. Les chercheurs attribuent en partie ce résultat à l'architecture : chaque couche de données dispose de son propre circuit de traitement, alors que les références empilent toutes les entrées sous forme de canaux. Sur les cratères à l'échelle du mètre et les IMP, les résultats sont à peu près à égalité avec les meilleures références, dans la marge de variation d'une exécution à l'autre. IBM revendique une avance de 3 % sur les IMP, mais les chiffres semblent comparables plutôt que nettement supérieurs.
LoRA, une méthode d'affinage plus légère qui n'entraîne qu'une fraction des paramètres, a fait jeu égal avec l'affinage complet et s'est même montrée meilleure pour la détection de cratères.
Des limites connues
Le modèle n'est pas adapté au positionnement géodésique absolu. Lors des tests de génération, la latitude et la longitude étaient parfois décalées de plusieurs dizaines de degrés, et l'altitude pouvait apparaître à des hauteurs décalées même lorsque les formes étaient correctes. Les auteurs le présentent comme une base pour des tâches en aval, et non comme un substitut aux instruments physiques. Les expériences contrôlées isolant chaque choix de conception sont encore à venir, et certains jeux de test sont de petite taille.
Juan Bernabé-Moreno, directeur d'IBM Research Europe, a déclaré que le modèle relie les observations de différents instruments et fait émerger des schémas difficiles à repérer isolément.
Le modèle est disponible sur Hugging Face, le code sur GitHub, et il est intégré à la boîte à outils open source TerraTorch. Les jeux de données de préentraînement et les bancs d'essai sont également publics.
Notre analyse
Cette publication s'inscrit dans une tendance de fond. La NASA et IBM travaillent sur des modèles de fondation dans le cadre d'un Space Act Agreement depuis début 2022, à commencer par le modèle d'observation de la Terre Prithvi en 2023. AlphaEarth Foundations, de Google DeepMind, repose sur une idée similaire appliquée à la Terre. Elle rejoint aussi d'autres initiatives visant à faire de l'IA un véritable outil de recherche pour les scientifiques, ainsi qu'un intérêt plus large pour l'IA et l'espace.
La présentation honnête des limites est appréciable. Le meilleur résultat, la prédiction de la glace, semble tenir en partie à l'architecture plutôt qu'au seul préentraînement, ce qui laisse penser que les enseignements de conception pourraient compter autant que les poids. Reste à voir si les études d'ablation annoncées confirmeront quels éléments expliquent réellement ces gains, et si des chercheurs lunaires extérieurs adopteront le modèle pour la planification de vraies missions.
