Olmo-core 3: Ai2 acelera el entrenamiento de modelos MoE
El Allen Institute for AI (Ai2), una organización de investigación en inteligencia artificial con sede en Seattle, presentó el jueves un nuevo framework para entrenar grandes modelos de lenguaje basados en el diseño mixture-of-experts (mezcla de expertos). El framework, llamado Olmo-core 3, pretende llevar el entrenamiento MoE a la escala del billón de parámetros, con un uso eficiente de la computación y los costes bajo control.
El código y los sistemas asociados ya están disponibles en GitHub para los desarrolladores y la comunidad de código abierto.
Por qué cuesta tanto entrenar modelos mixture-of-experts
Un modelo denso utiliza todos sus parámetros con cada token que procesa. Un token es un pequeño fragmento de texto, a menudo una palabra o parte de una palabra, que el modelo lee o genera. Los parámetros son los valores internos que determinan cómo se comporta el modelo.
Un modelo mixture-of-experts funciona de otra manera. Contiene muchas subredes especializadas, llamadas expertos, y envía cada token solo a unas pocas. El modelo puede tener muchos más parámetros en total, pero en cada paso solo calcula con una pequeña parte de ellos. Por eso los diseños MoE se han vuelto populares en los modelos grandes, incluidos lanzamientos abiertos eficientes como Qwen3.6-35B-A3B.
En el entrenamiento ocurre lo mismo. Cada token activa solo una parte del modelo, así que la computación total se reduce. El problema está en la memoria y en la red. El modelo completo tiene que caber igualmente en la memoria de alguna GPU, y los expertos tienen que coordinarse a través de la red durante el entrenamiento. Ambas cosas suman costes.
Según Ai2, Olmo-core 3 se ha diseñado para cerrar la brecha entre el entrenamiento denso y el MoE. En su configuración, el conjunto de expertos puede crecer de ocho a 128 mientras cada token sigue utilizando solo cuatro. Con la misma infraestructura, Ai2 asegura que los modelos pueden superar el billón de parámetros.
Las cifras del benchmark
Ai2 ha publicado una comparación principal. Al entrenar un modelo de 47.000 millones de parámetros en GPU Nvidia B3000, Olmo-core 3 procesó 52.000 tokens por segundo. Megatron-core, de Nvidia, un framework consolidado para el entrenamiento de grandes modelos MoE, alcanzó como máximo unos 19.400 tokens por segundo en esa misma comparación. Eso supone aproximadamente 2,7 veces más rendimiento.
Son cifras de la propia Ai2. Las pruebas independientes con otros tamaños de modelo y otro hardware mostrarán hasta qué punto se mantiene la mejora.
Cómo ahorra memoria
Un documento técnico sobre el proyecto describe tres técnicas que funcionan de forma conjunta:
Paralelismo de expertos. Los expertos se reparten entre varias GPU, de modo que cada tarjeta solo alberga una parte del conjunto de expertos.
División por capas. Las capas del modelo, es decir, sus sucesivas etapas de procesamiento, se dividen entre grupos de GPU. Así, cada GPU guarda en memoria una parte más pequeña del modelo.
Un optimizador distribuido. El entrenamiento necesita datos adicionales, el llamado estado del optimizador, para calcular y aplicar las actualizaciones. En lugar de guardar una copia completa en cada GPU, Olmo-core 3 reparte ese estado entre muchas de ellas.
El efecto combinado es una menor sobrecarga de memoria a medida que crecen los modelos, porque ningún dispositivo tiene que almacenar a la vez todo el modelo y su estado de entrenamiento.
Ai2 también es compatible con MXFP8, un formato numérico que almacena algunos valores con menos bits. Esto puede reducir tanto la cantidad de computación como el volumen de datos que se mueve entre GPU.
Pensado para investigadores, no solo para los grandes laboratorios
Ai2 enmarca el lanzamiento en un objetivo más amplio: dar a los investigadores las herramientas para construir y entrenar modelos más grandes. Los modelos de un billón de parámetros suelen quedar fuera del alcance de quien no dispone de una infraestructura a escala gubernamental o empresarial.
La organización afirma que Olmo-core 3 también permitirá a los investigadores adaptar el entrenamiento MoE a distinto hardware y experimentar con el enrutamiento, el paralelismo y otras partes del sistema. El objetivo declarado es hacer crecer un ecosistema más amplio en torno a estos métodos.
Nuestra opinión
Lo interesante de este lanzamiento no es un modelo nuevo. Son las tuberías. La mayor parte de la atención en el código abierto se la llevan los pesos de los modelos, pero son los frameworks de entrenamiento los que deciden quién puede construir modelos grandes en primer lugar. Si las cifras de rendimiento de Ai2 se confirman fuera de sus propios benchmarks, una aceleración de alrededor de 2,7 veces frente a Megatron-core supondría una reducción de costes significativa para grupos académicos y laboratorios más pequeños.
Encaja en una tendencia más amplia de trabajo en infraestructura abierta que busca que la IA a gran escala dependa menos de unos pocos proveedores, en la línea de las herramientas de código abierto de Deepseek para los chips Huawei Ascend. La promesa de Ai2 de que los investigadores podrán adaptar el entrenamiento MoE a distinto hardware apunta en una dirección parecida, aunque los benchmarks publicados hasta ahora se ejecutan en GPU de Nvidia.
Conviene ser prudentes. Un entrenamiento más rápido no elimina la necesidad de grandes clústeres de GPU, y las ejecuciones de un billón de parámetros seguirán siendo caras. Habrá que ver si grupos independientes reproducen el rendimiento anunciado, si el framework funciona bien en hardware que no sea de Nvidia y si en los próximos meses aparece algún modelo abierto destacado entrenado con Olmo-core 3. Esa sería la señal más clara de que la herramienta está rebajando la barrera de entrada, y no simplemente desplazándola.
