Mistral Large 4: Billionen-Modell "Le Chonk" fordert Rivalen
Das französische KI-Labor Mistral AI hat am Dienstag Mistral Large 4 (ML4) veröffentlicht. Es handelt sich um ein großes multimodales Modell, das also mehr als eine Art von Eingabe verarbeiten kann. Mistral will damit sowohl gegen amerikanische als auch gegen chinesische Labore antreten. Die Veröffentlichung zeigt außerdem, dass Europa weiterhin an der Spitze der KI-Entwicklung mitspielen will.
Mistral stellt den Start unter eine Idee, die der französische Präsident Emmanuel Macron als "einen dritten Weg in der KI" bezeichnet hat. Der Markt teilt sich zunehmend in geschlossene Modelle, die ihre Eigentümer abschalten können, und offene Modelle, von denen viele aus China stammen. Mistral positioniert ML4 als Alternative zu beiden.
Eine Billion Parameter, die Gewichte folgen noch
ML4 hat eine Billion Parameter, daher auch der interne Spitzname Le Chonk. Ein Open-Weight-Modell ist es allerdings noch nicht. "Open Weight" bedeutet, dass die trainierten Modellparameter veröffentlicht werden, sodass andere sie herunterladen, ausführen und untersuchen können.
Vorerst lässt sich ML4 nur über einen öffentlichen Endpunkt mit eingebauten Schutzmechanismen nutzen. Mistral will die Gewichte nach eigenen Angaben in drei Wochen freigeben, sobald die Sicherheitstests abgeschlossen sind.
Pierre Stock, VP Science bei Mistral, sagte TechCrunch, das Unternehmen werde diese Zeit nutzen, um "mit vertrauenswürdigen Partnern und Regierungen sicherzustellen, dass die Open-Source-Gewichte zur Verteidigung genutzt werden können, aber nicht, um böswillige Angriffe [durchzuführen]."
Die gestaffelte Einführung spiegelt wachsende Sicherheitsbedenken wider. Laut Stock haben diese in den vergangenen Monaten zugenommen, vor allem bei Unternehmen und Institutionen, die zu Mistrals Kernkunden zählen. Stock argumentierte zudem, dass offene Gewichte einen eigenen Sicherheitsvorteil haben, weil sich ein offenes Modell leichter prüfen lässt.
Trainiert mit weniger GPUs
Mistral hat ML4 vollständig auf eigener Rechenleistung trainiert, mit 4.000 Nvidia-GPUs. Das sei "zwei- bis dreimal weniger als bei unseren chinesischen Konkurrenten und deutlich weniger als bei den Closed-Source-Konkurrenten", sagte Stock.
Diese Zahl ist wichtig. Sie deutet darauf hin, dass Mistral Effizienz statt schierer Größe als seinen Vorteil gegenüber Rivalen mit weit mehr Hardware darstellt.
Wo Mistral mit ML4 punkten will
Benchmark-Ergebnisse wurden noch nicht veröffentlicht, alle Leistungsversprechen sind also bislang unbestätigt. Stock sagte, Mistral hoffe, dass ML4 das beste verfügbare Open-Weight-Modell wird, insbesondere außerhalb Chinas, wobei er den Anspruch nicht auf diesen Markt beschränkte.
Das Unternehmen zielt außerdem auf bestimmte Fachgebiete. Weil das Training gezielt ausgerichtet war, glaubt Mistral, dass ML4 geschlossene Modelle in Bereichen schlagen könnte, die für seine Kunden am wichtigsten sind, vor allem dort, wo multimodale Fähigkeiten nützlich sind. Stock nannte drei Einsatzbereiche:
- Cybersicherheit
- Finanzwesen
- Chipdesign
Das Chipdesign hängt direkt mit Mistrals Investoren zusammen. Der niederländische Chipanlagenhersteller ASML führte Mistrals Series-C-Runde an. Samsung führte im vergangenen Monat die Series-D-Runde an, die das Unternehmen mit 21 Milliarden Euro (rund 24,39 Milliarden US-Dollar) bewertete.
Mehr als ein Inferenzanbieter
Es geht auch um die Positionierung. Im Umfeld seiner jüngsten Finanzierungsrunde hatte Mistral erklärt, die Entscheidung, chinesische Modelle zu hosten, bedeute nicht, dass es zu einem bloßen Inferenzanbieter werde, also einem Unternehmen, das nur die Modelle anderer Entwickler betreibt. Mit Le Chonk argumentiert Mistral, dass es weiterhin als Frontier-Labor gelten sollte, das eigene Spitzenmodelle trainiert.
Das große Ganze
Für alle, die das Rennen um offene Modelle verfolgen, ist ML4 eine direkte Herausforderung für die Vorstellung, dass ernstzunehmende Open-Weight-Modelle inzwischen vor allem aus China kommen. US-Start-ups gehen ähnliche Schritte, wie Reflections Modell Beam zeigt. In Europa hat auch Aleph Alpha Open-Weight-Modelle für Unternehmenskunden vorangetrieben, was darauf hindeutet, dass sich in der Region eine Alternative zu US-amerikanischen und chinesischen Laboren herausbildet.
Die dreiwöchige Sperrfrist vor der Freigabe der Gewichte könnte sich als der bedeutendere Teil des Starts erweisen. Jüngste Ergebnisse zeigen, dass offene Modelle bei offensiven Sicherheitsaufgaben immer stärker werden. Mistrals Plan, vor der Veröffentlichung gemeinsam mit Regierungen zu testen, könnte zur Vorlage dafür werden, wie große offene Modelle veröffentlicht werden.
Drei Dinge sind im Auge zu behalten. Erstens, ob unabhängige Benchmarks Mistrals Anspruch auf Bestwerte bestätigen. Zweitens, ob die Gewichte tatsächlich pünktlich erscheinen. Drittens, ob sich ML4 für Partner wie ASML und Samsung im Chipdesign als nützlich erweist.
