Olmo-core 3: Ai2 versnelt training van mixture-of-experts

Olmo-core 3: Ai2 versnelt training van mixture-of-experts

Het Allen Institute for AI (Ai2), een AI-onderzoeksinstituut uit Seattle, heeft donderdag een nieuw framework uitgebracht voor het trainen van grote taalmodellen die zijn gebouwd op het mixture-of-experts-ontwerp. Het framework heet Olmo-core 3 en moet MoE-training opschalen naar een biljoen parameters, terwijl het rekenverbruik efficient blijft en de kosten beheersbaar.

De code en de bijbehorende systemen staan vanaf nu op GitHub voor ontwikkelaars en de opensourcegemeenschap.

Waarom mixture-of-expertsmodellen lastig te trainen zijn

Een dicht model gebruikt al zijn parameters voor elk token dat het verwerkt. Een token is een klein stukje tekst, vaak een woord of een deel van een woord, dat een model leest of genereert. Parameters zijn de interne waarden die bepalen hoe het model zich gedraagt.

Een mixture-of-expertsmodel werkt anders. Het bevat veel gespecialiseerde subnetwerken, experts genoemd, en stuurt elk token naar maar een paar daarvan. Het model kan in totaal veel meer parameters bevatten, maar rekent per stap maar met een klein deel ervan. Daarom zijn MoE-ontwerpen populair geworden voor grote modellen, waaronder efficiente open releases zoals Qwen3.6-35B-A3B.

Bij het trainen geldt dezelfde logica. Elk token activeert maar een deel van het model, dus de totale rekenlast daalt. Het addertje zit in het geheugen en het netwerk. Het volledige model moet nog steeds ergens in het GPU-geheugen passen, en de experts moeten tijdens de training via het netwerk op elkaar worden afgestemd. Beide drijven de kosten op.

Volgens Ai2 is Olmo-core 3 ontworpen om de kloof tussen dichte training en MoE-training te dichten. In de opzet van Ai2 kan het aantal experts groeien van acht naar 128, terwijl elk token er nog steeds maar vier gebruikt. Op dezelfde infrastructuur kunnen modellen volgens Ai2 doorgroeien tot voorbij de 1 biljoen parameters.

De benchmarkcijfers

Ai2 publiceerde een belangrijkste vergelijking. Bij het trainen van een model met 47 miljard parameters op Nvidia B3000-GPU's verwerkte Olmo-core 3 52.000 tokens per seconde. Megatron-core van Nvidia, een gevestigd framework voor grootschalige MoE-training, kwam in dezelfde vergelijking tot een piek van ongeveer 19.400 tokens per seconde. Dat komt neer op ruwweg 2,7 keer zoveel doorvoer.

Het gaat om cijfers van Ai2 zelf. Onafhankelijke tests met andere modelgroottes en andere hardware moeten uitwijzen in hoeverre de winst overeind blijft.

Hoe het geheugen bespaart

Een whitepaper over het project beschrijft drie technieken die samenwerken:

Expertparallellisme. De experts worden over meerdere GPU's verdeeld, zodat elke kaart maar een deel van alle experts bevat.

Opsplitsen van lagen. De lagen van het model, de opeenvolgende verwerkingsstappen, worden verdeeld over groepen GPU's. Elke GPU houdt daardoor minder van het model in het geheugen.

Een gedistribueerde optimizer. Training heeft extra gegevens nodig, de zogeheten optimizer-state, om updates te berekenen en door te voeren. In plaats van op elke GPU een volledige kopie te bewaren, verdeelt Olmo-core 3 die gegevens over veel GPU's.

Samen zorgt dat voor minder geheugenoverhead naarmate modellen groeien, omdat geen enkel apparaat in zijn eentje het hele model en de bijbehorende trainingsgegevens tegelijk hoeft vast te houden.

Ai2 ondersteunt ook MXFP8, een getalformaat dat sommige waarden met minder bits opslaat. Dat kan zowel de hoeveelheid rekenwerk als de hoeveelheid data die tussen GPU's wordt verstuurd verminderen.

Gebouwd voor onderzoekers, niet alleen voor grote labs

Ai2 presenteert de release als onderdeel van een breder doel: onderzoekers de middelen geven om grotere modellen te bouwen en te trainen. Modellen met een biljoen parameters zijn meestal onbereikbaar voor iedereen zonder infrastructuur op het niveau van een overheid of een groot bedrijf.

Volgens de organisatie kunnen onderzoekers met Olmo-core 3 ook MoE-training aanpassen aan verschillende hardware en experimenteren met routering, parallellisme en andere onderdelen van het systeem. Het uitgesproken doel is om rond deze methoden een breder ecosysteem te laten ontstaan.

Onze kijk

Het interessante aan deze release is niet een nieuw model. Het is het leidingwerk. De meeste aandacht in de opensourcewereld gaat naar modelgewichten, maar het zijn trainingsframeworks die bepalen wie ueberhaupt grote modellen kan bouwen. Als de doorvoercijfers van Ai2 ook buiten de eigen benchmarks standhouden, betekent een versnelling van ongeveer 2,7 keer ten opzichte van Megatron-core een flinke kostenbesparing voor academische groepen en kleinere labs.

Het past in een breder patroon van open infrastructuurwerk dat grootschalige AI minder afhankelijk moet maken van een handvol leveranciers, vergelijkbaar met de opensourcetools van Deepseek voor Huawei Ascend-chips. De belofte van Ai2 dat onderzoekers MoE-training kunnen aanpassen aan verschillende hardware wijst in een vergelijkbare richting, al draaien de benchmarks die tot nu toe zijn gepubliceerd op GPU's van Nvidia.

Enige voorzichtigheid is op zijn plaats. Snellere training neemt de noodzaak van grote GPU-clusters niet weg, en trainingsruns met een biljoen parameters blijven duur. Het is de moeite waard om in de gaten te houden of onafhankelijke groepen de gerapporteerde doorvoer kunnen reproduceren, of het framework goed presteert op hardware van andere fabrikanten dan Nvidia, en of er de komende maanden noemenswaardige open modellen verschijnen die met Olmo-core 3 zijn getraind. Dat zou het duidelijkste teken zijn dat de tool de drempel echt verlaagt en niet alleen verlegt.