Aleph Alpha Kolibri: open-weight Duits-Engels taalmodel
Het Duitse AI-bedrijf Aleph Alpha heeft Kolibri uitgebracht, een tweetalig Duits-Engels taalmodel met openlijk beschikbare gewichten. Het bedrijf presenteert het als een praktisch hulpmiddel voor de overheid, de luchtvaart en de industrie. Daarnaast ziet het het model als bewijs dat Europa op eigen voorwaarden concurrerende AI kan bouwen.
Kolibri is het Duitse woord voor kolibrie. Volgens het technische rapport van het bedrijf is het model getraind op Europese hardware, ontwikkeld onder Europees recht en ontworpen met de EU AI Act in het achterhoofd. De AI Act is het kader van de Europese Unie voor de regulering van AI-systemen.
Een groot model dat licht draait
Op papier heeft Kolibri 78 miljard parameters. In de praktijk gebruikt het er voor elk afzonderlijk token maar zo'n drie miljard. Dat komt door een mixture-of-experts-architectuur, die het netwerk opsplitst in gespecialiseerde subnetwerken en elk token door slechts een paar daarvan stuurt.
De afweging is eenvoudig. Een model dat zo is opgebouwd, kan veel kennis kwijt in zijn totale aantal parameters, terwijl de rekenkosten per token dichter bij die van een veel kleiner model blijven. Die aanpak is inmiddels gangbaar in de hele sector, en tools om mixture-of-experts-modellen te trainen op een efficientere manier krijgen zelf ook steeds meer aandacht.
Andere details uit de release:
- Contextvenster: tot een miljoen tokens.
- Trainingshardware: 768 Nvidia B200-GPU's in Duitsland en Finland.
- Licentie: Apache 2.0, een ruime open-sourcelicentie die commercieel gebruik toestaat.
- Distributie: de gewichten zijn beschikbaar op Hugging Face.
De claim over kwaliteit en kosten
De belangrijkste prestatieclaim van Aleph Alpha is dat Kolibri voor zowel het Duits als het Engels op het Pareto-front ligt. Simpel gezegd stelt het bedrijf dat geen van de vergeleken modellen betere kwaliteit levert tegen dezelfde gebruikskosten, en dat geen enkel model goedkoper draait bij dezelfde kwaliteit.
Volgens het bedrijf verslaat Kolibri vergelijkbare modellen met een soortgelijke architectuur op kwaliteit of op kosten. Een deel van die vergelijkingsmodellen is aanzienlijk ouder, met releasedata in maart en april 2026. Dat detail is belangrijk om de claim goed te kunnen beoordelen. In een vakgebied dat zo snel beweegt, kan een verschil van een paar maanden het beeld van de benchmarks flink veranderen.
Gebouwd voor het Duits
De tweetalige focus is niet alleen marketing. Duits maakt 21,3 procent van de trainingsdata uit. Aleph Alpha heeft voor het project een speciale Duitse datapijplijn gebouwd om dat materiaal te verzamelen en voor te bereiden.
De meeste frontiermodellen worden vooral op Engelse tekst getraind, en hun prestaties in andere talen blijven vaak achter. Voor Duitse overheidsdiensten of fabrikanten die grotendeels in het Duits werken, kan een model met een bewust Duitse basis beter passen dan een algemeen systeem waar het Duits later aan is toegevoegd.
Een soevereiniteitsmodel met Chinese input
Er is een detail dat het verhaal ingewikkelder maakt. Aleph Alpha heeft Chinese modellen gebruikt om synthetische trainingsdata voor Kolibri te genereren. Synthetische data, oftewel tekst die door andere AI-systemen is gemaakt en wordt gebruikt om nieuwe systemen te trainen, is inmiddels een standaardtechniek. Toch past het slecht bij een boodschap over soevereiniteit.
Het valt des te meer op omdat Aleph Alpha zelf onderzoek heeft gepubliceerd over hoe Chinese modellen de staatsdoctrine napraten. De release vermeldt niet hoe het bedrijf de synthetische data heeft gefilterd of gecontroleerd, dus lezers doen er goed aan dat als een open vraag te beschouwen.
Onze analyse
Kolibri is een duidelijk signaal van waar Aleph Alpha de concurrentie wil aangaan. Het bedrijf probeert niet de grootste Amerikaanse labs bij te benen op pure capaciteit. Het verkoopt efficientie, taalkundige aansluiting, juridische afstemming op de EU-regels en de geruststelling van in Europa getrainde gewichten. Voor organisaties in gereguleerde sectoren zoals de overheid en de luchtvaart kan die combinatie zwaarder wegen dan bovenaan een algemene ranglijst staan.
De architectuur past ook in een bredere trend. Sparse modellen met een paar miljard actieve parameters worden steeds populairder omdat ze goedkoper zijn in gebruik, zoals te zien is bij releases als het compacte programmeermodel van Qwen. De Apache 2.0-licentie verlaagt de drempel nog verder, omdat bedrijven het model op hun eigen infrastructuur kunnen inzetten zonder over voorwaarden te hoeven onderhandelen.
Enige voorzichtigheid is op zijn plaats. De prestatieclaims komen uit het eigen rapport van Aleph Alpha, en de vergelijking omvat modellen die al enkele maanden oud zijn. Het is de moeite waard om te volgen of onafhankelijke benchmarks de Pareto-frontclaim bevestigen tegenover nieuwere concurrenten. Een andere open vraag is of overheidsinstanties en industriele bedrijven Kolibri ook echt in productie gaan gebruiken. Het gebruik van door Chinese modellen gegenereerde synthetische data kan bovendien vragen oproepen bij juist de klanten die het meest om soevereiniteit geven. Hoe Aleph Alpha daarop antwoordt, kan bepalen hoe geloofwaardig het Europese AI-verhaal overkomt.
