Olmo-core 3: Ai2 beschleunigt Mixture-of-Experts-Training

Olmo-core 3: Ai2 beschleunigt Mixture-of-Experts-Training

Das Allen Institute for AI (Ai2), eine KI-Forschungseinrichtung aus Seattle, hat am Donnerstag ein neues Framework zum Training großer Sprachmodelle vorgestellt, die auf dem Mixture-of-Experts-Prinzip aufbauen. Das Framework mit dem Namen Olmo-core 3 soll das MoE-Training bis in den Bereich von Billionen Parametern bringen und dabei die Rechenleistung effizient nutzen und die Kosten im Rahmen halten.

Der Code und die zugehörigen Systeme stehen ab sofort auf GitHub für Entwickler und die Open-Source-Gemeinschaft bereit.

Warum Mixture-of-Experts-Modelle schwer zu trainieren sind

Ein dichtes Modell nutzt für jedes Token, das es verarbeitet, alle seine Parameter. Ein Token ist ein kleines Textstück, oft ein Wort oder ein Wortteil, das ein Modell liest oder erzeugt. Parameter sind die internen Werte, die das Verhalten des Modells bestimmen.

Ein Mixture-of-Experts-Modell funktioniert anders. Es enthält viele spezialisierte Teilnetze, sogenannte Experten, und leitet jedes Token nur an einige wenige davon weiter. Das Modell kann insgesamt weit mehr Parameter enthalten, rechnet aber in jedem einzelnen Schritt nur mit einem kleinen Teil davon. Deshalb sind MoE-Architekturen bei großen Modellen so beliebt geworden, auch bei effizienten offenen Veröffentlichungen wie Qwen3.6-35B-A3B.

Beim Training gilt dieselbe Logik. Jedes Token aktiviert nur einen Teil des Modells, also sinkt der gesamte Rechenaufwand. Der Haken liegt beim Speicher und beim Netzwerk. Das vollständige Modell muss trotzdem irgendwo in den GPU-Speicher passen, und die Experten müssen sich während des Trainings über das Netzwerk abstimmen. Beides kostet.

Laut Ai2 wurde Olmo-core 3 entwickelt, um die Lücke zwischen dichtem und MoE-Training zu schließen. In dem Aufbau kann der Pool an Experten von acht auf 128 wachsen, während jedes Token weiterhin nur vier davon nutzt. Auf derselben Infrastruktur lassen sich Modelle nach Angaben von Ai2 auf mehr als 1 Billion Parameter skalieren.

Die Benchmark-Zahlen

Ai2 hat einen zentralen Vergleich veröffentlicht. Beim Training eines Modells mit 47 Milliarden Parametern auf Nvidia-B3000-GPUs verarbeitete Olmo-core 3 52.000 Token pro Sekunde. Nvidias Megatron-core, ein etabliertes Framework für großes MoE-Training, kam im selben Vergleich in der Spitze auf rund 19.400 Token pro Sekunde. Das entspricht etwa dem 2,7-fachen Durchsatz.

Es handelt sich um Ai2s eigene Zahlen. Unabhängige Tests mit anderen Modellgrößen und anderer Hardware werden zeigen, wie weit sich der Vorsprung übertragen lässt.

Wie Speicher gespart wird

Ein Whitepaper zum Projekt beschreibt drei Techniken, die zusammenwirken:

Expertenparallelität. Die Experten werden auf mehrere GPUs verteilt, sodass jede Karte nur einen Teil des Expertenpools vorhält.

Aufteilung der Schichten. Die Schichten des Modells, also die aufeinanderfolgenden Verarbeitungsstufen, werden auf Gruppen von GPUs aufgeteilt. Jede GPU muss dadurch weniger vom Modell im Speicher halten.

Ein verteilter Optimierer. Das Training benötigt zusätzliche Daten, den sogenannten Optimiererzustand, um Aktualisierungen zu berechnen und anzuwenden. Statt auf jeder GPU eine vollständige Kopie davon zu halten, verteilt Olmo-core 3 diesen Zustand auf viele GPUs.

Zusammen sorgt das für geringeren Speicherbedarf, wenn die Modelle wachsen, weil kein einzelnes Gerät das gesamte Modell samt Trainingszustand auf einmal halten muss.

Außerdem unterstützt Ai2 MXFP8, ein Zahlenformat, das manche Werte mit weniger Bits speichert. Das kann sowohl den Rechenaufwand als auch die Datenmenge senken, die zwischen den GPUs verschoben wird.

Gebaut für Forschende, nicht nur für große Labore

Ai2 ordnet die Veröffentlichung in ein größeres Ziel ein: Forschenden die Werkzeuge an die Hand zu geben, um größere Modelle zu bauen und zu trainieren. Modelle mit Billionen Parametern sind für alle, die nicht über Infrastruktur im Maßstab von Staaten oder Großkonzernen verfügen, meist unerreichbar.

Nach Angaben der Organisation sollen Forschende mit Olmo-core 3 das MoE-Training außerdem an unterschiedliche Hardware anpassen und mit dem Routing, der Parallelisierung und anderen Teilen des Systems experimentieren können. Erklärtes Ziel ist es, ein breiteres Ökosystem rund um diese Methoden aufzubauen.

Unsere Einschätzung

Das Spannende an dieser Veröffentlichung ist kein neues Modell, sondern die Infrastruktur dahinter. Im Open-Source-Bereich richtet sich die meiste Aufmerksamkeit auf Modellgewichte, doch es sind die Trainings-Frameworks, die überhaupt erst darüber entscheiden, wer große Modelle bauen kann. Sollten sich Ai2s Durchsatzwerte auch außerhalb der eigenen Benchmarks bestätigen, wäre eine Beschleunigung um rund das 2,7-fache gegenüber Megatron-core eine spürbare Kostenersparnis für Hochschulgruppen und kleinere Labore.

Das passt zu einem breiteren Trend offener Infrastrukturarbeit, die großskalige KI unabhängiger von wenigen Anbietern machen soll, ähnlich wie Deepseeks Open-Source-Werkzeuge für Huaweis Ascend-Chips. Ai2s Versprechen, dass Forschende das MoE-Training an unterschiedliche Hardware anpassen können, weist in eine ähnliche Richtung, auch wenn die bisher veröffentlichten Benchmarks auf Nvidia-GPUs laufen.

Etwas Vorsicht ist angebracht. Schnelleres Training ändert nichts daran, dass große GPU-Cluster nötig sind, und Trainingsläufe mit Billionen Parametern bleiben teuer. Es lohnt sich zu beobachten, ob unabhängige Gruppen den angegebenen Durchsatz reproduzieren, ob das Framework auch auf Hardware jenseits von Nvidia gut läuft und ob in den kommenden Monaten nennenswerte offene Modelle erscheinen, die mit Olmo-core 3 trainiert wurden. Das wäre das deutlichste Zeichen dafür, dass das Werkzeug die Hürde tatsächlich senkt und sie nicht nur verschiebt.