Olmo-core 3 : Ai2 accélère l'entraînement des modèles MoE

Olmo-core 3 : Ai2 accélère l'entraînement des modèles MoE

L'Allen Institute for AI (Ai2), un organisme de recherche en IA basé à Seattle, a dévoilé jeudi un nouveau framework pour entraîner les grands modèles de langage reposant sur l'architecture mixture-of-experts (mélange d'experts). Baptisé Olmo-core 3, il doit permettre de porter l'entraînement des modèles MoE à l'échelle du trillion de paramètres, tout en optimisant l'usage de la puissance de calcul et en maîtrisant les coûts.

Le code et les outils associés sont dès à présent disponibles sur GitHub pour les développeurs et la communauté open source.

Pourquoi les modèles mixture-of-experts sont difficiles à entraîner

Un modèle dense mobilise l'ensemble de ses paramètres pour chaque token qu'il traite. Un token est un petit fragment de texte, souvent un mot ou une partie de mot, que le modèle lit ou génère. Les paramètres sont les valeurs internes qui déterminent le comportement du modèle.

Un modèle mixture-of-experts fonctionne autrement. Il contient de nombreux sous-réseaux spécialisés, appelés experts, et n'envoie chaque token qu'à quelques-uns d'entre eux. Le modèle peut ainsi compter beaucoup plus de paramètres au total, mais il n'en sollicite qu'une petite partie à chaque étape. C'est pour cette raison que les architectures MoE se sont imposées pour les grands modèles, y compris pour des modèles ouverts économes comme Qwen3.6-35B-A3B.

L'entraînement obéit à la même logique. Chaque token n'active qu'une partie du modèle, ce qui réduit le calcul total. Le problème se situe du côté de la mémoire et du réseau. Le modèle complet doit malgré tout tenir quelque part dans la mémoire des GPU, et les experts doivent se coordonner via le réseau pendant l'entraînement. Deux postes qui alourdissent la facture.

Selon Ai2, Olmo-core 3 a été conçu pour combler l'écart entre l'entraînement des modèles denses et celui des modèles MoE. Dans sa configuration, le nombre d'experts peut passer de huit à 128 tandis que chaque token n'en utilise toujours que quatre. Sur la même infrastructure, les modèles peuvent dépasser 1 trillion de paramètres, assure Ai2.

Les chiffres des benchmarks

Ai2 a publié une comparaison phare. Pour l'entraînement d'un modèle de 47 milliards de paramètres sur des GPU Nvidia B3000, Olmo-core 3 a traité 52 000 tokens par seconde. Megatron-core de Nvidia, un framework éprouvé pour l'entraînement de grands modèles MoE, a plafonné à environ 19 400 tokens par seconde dans le même test. Soit un débit environ 2,7 fois supérieur.

Ces chiffres sont ceux d'Ai2. Des tests indépendants sur d'autres tailles de modèles et d'autres matériels diront dans quelle mesure ce gain se confirme.

Comment il économise la mémoire

Un livre blanc consacré au projet décrit trois techniques complémentaires :

Le parallélisme d'experts. Les experts sont répartis sur plusieurs GPU, si bien que chaque carte n'en héberge qu'une partie.

Le découpage des couches. Les couches du modèle, c'est-à-dire ses étapes de traitement successives, sont réparties entre des groupes de GPU. Chaque GPU garde ainsi une part plus réduite du modèle en mémoire.

Un optimiseur distribué. L'entraînement nécessite des données supplémentaires, appelées état de l'optimiseur, pour calculer et appliquer les mises à jour. Plutôt que d'en conserver une copie complète sur chaque GPU, Olmo-core 3 répartit cet état sur un grand nombre d'entre eux.

Résultat combiné : une empreinte mémoire plus faible à mesure que les modèles grossissent, puisqu'aucune machine n'a à stocker à elle seule l'intégralité du modèle et de son état d'entraînement.

Ai2 prend également en charge MXFP8, un format numérique qui stocke certaines valeurs sur moins de bits. De quoi réduire à la fois le volume de calcul et la quantité de données échangées entre GPU.

Pensé pour les chercheurs, pas seulement pour les grands labos

Ai2 présente cette sortie comme un pas vers un objectif plus large : donner aux chercheurs les outils nécessaires pour concevoir et entraîner des modèles plus grands. Les modèles à un trillion de paramètres restent généralement hors de portée de quiconque ne dispose pas d'une infrastructure à l'échelle d'un État ou d'une grande entreprise.

L'organisme indique qu'Olmo-core 3 permettra aussi aux chercheurs d'adapter l'entraînement MoE à différents matériels et d'expérimenter sur le routage, le parallélisme et d'autres composants du système. L'ambition affichée est de faire émerger un écosystème plus large autour de ces méthodes.

Notre analyse

Ce qui retient l'attention ici, ce n'est pas un nouveau modèle. C'est la tuyauterie. L'essentiel de l'attention portée à l'open source se concentre sur les poids des modèles, mais ce sont les frameworks d'entraînement qui déterminent qui peut réellement construire de grands modèles. Si les chiffres de débit d'Ai2 se confirment en dehors de ses propres benchmarks, une accélération d'environ 2,7 fois par rapport à Megatron-core représenterait une baisse de coûts significative pour les équipes universitaires et les petits labos.

Cette annonce s'inscrit dans une tendance plus large : des infrastructures ouvertes visant à rendre l'IA à grande échelle moins dépendante d'une poignée de fournisseurs, à l'image des outils open source de Deepseek pour les puces Huawei Ascend. La promesse d'Ai2 de permettre aux chercheurs d'adapter l'entraînement MoE à différents matériels va dans le même sens, même si les benchmarks publiés jusqu'ici tournent sur des GPU Nvidia.

Une certaine prudence s'impose. Un entraînement plus rapide ne supprime pas le besoin de grands clusters de GPU, et les entraînements à un trillion de paramètres resteront coûteux. Reste à voir si des équipes indépendantes parviennent à reproduire les débits annoncés, si le framework tient ses promesses sur du matériel non Nvidia, et si des modèles ouverts notables entraînés avec Olmo-core 3 voient le jour dans les prochains mois. Ce serait le signe le plus clair que l'outil abaisse réellement la barrière, et ne se contente pas de la déplacer.