Mistral Large 4: "Le Chonk" met 1 biljoen parameters
Het Franse AI-lab Mistral AI heeft dinsdag Mistral Large 4 (ML4) uitgebracht. Het gaat om een groot multimodaal model, wat betekent dat het meer dan één soort invoer aankan, en Mistral wil er zowel Amerikaanse als Chinese labs mee beconcurreren. De lancering laat ook zien dat Europa nog altijd van plan is mee te doen aan de top van de AI-ontwikkeling.
Mistral plaatst de lancering in het kader van een idee dat de Franse president Emmanuel Macron "een derde weg in AI" heeft genoemd. De markt raakt steeds meer verdeeld tussen gesloten modellen, die hun eigenaren kunnen uitschakelen, en open modellen, waarvan er veel uit China komen. Mistral presenteert ML4 als alternatief voor allebei.
Een biljoen parameters, gewichten volgen nog
ML4 heeft 1 biljoen parameters, wat de interne bijnaam Le Chonk verklaart. Een open-weight-model is het voorlopig echter nog niet. "Open weight" betekent dat de getrainde modelparameters worden gepubliceerd, zodat anderen ze kunnen downloaden, draaien en onderzoeken.
Voorlopig kun je ML4 alleen gebruiken via een openbaar endpoint met ingebouwde beveiligingen. Mistral zegt de gewichten over drie weken vrij te geven, zodra de veiligheidstests zijn afgerond.
Pierre Stock, VP Science bij Mistral, vertelde TechCrunch dat het bedrijf die tijd gebruikt om samen te werken "met vertrouwde partners en overheden om ervoor te zorgen dat de opensourcegewichten kunnen worden gebruikt om te verdedigen, maar niet om kwaadaardige aanvallen [uit te voeren]."
De gefaseerde uitrol weerspiegelt de groeiende zorgen over beveiliging. Volgens Stock zijn die zorgen de afgelopen maanden toegenomen, vooral bij bedrijven en instellingen, de kernklanten van Mistral. Stock voerde ook aan dat open gewichten zelf een beveiligingsvoordeel bieden, omdat een open model makkelijker te controleren is.
Getraind met minder GPU's
Mistral heeft ML4 volledig op eigen rekenkracht getraind, met 4.000 Nvidia-GPU's. Volgens Stock is dat "twee tot drie keer minder dan onze Chinese concurrenten, en aanzienlijk minder dan de closed-sourceconcurrenten."
Dat getal is belangrijk. Het wijst erop dat Mistral efficiëntie, en niet pure schaal, naar voren schuift als zijn voordeel tegenover rivalen met veel meer hardware.
Waar Mistral verwacht dat ML4 wint
Er zijn nog geen benchmarkresultaten gepubliceerd, dus alle claims over de prestaties zijn nog niet geverifieerd. Stock zei dat Mistral hoopt dat ML4 het beste beschikbare open-weight-model wordt, vooral buiten China, al beperkte hij de ambitie niet tot die markt.
Het bedrijf mikt ook op specifieke domeinen. Omdat de training gericht was, denkt Mistral dat ML4 gesloten modellen kan verslaan op terreinen die voor zijn klanten het zwaarst wegen, vooral waar multimodale functies van pas komen. Stock noemde drie beoogde toepassingen:
- Cyberbeveiliging
- Financiën
- Chipontwerp
Chipontwerp hangt direct samen met de investeerders van Mistral. De Nederlandse chipmachinemaker ASML leidde de Series C-ronde van Mistral. Samsung leidde vorige maand de Series D, waarbij het bedrijf op 21 miljard euro (ongeveer 24,39 miljard dollar) werd gewaardeerd.
Meer dan een inferentieaanbieder
Er speelt ook een kwestie van positionering. Rond de laatste financieringsronde zei Mistral dat de beslissing om Chinese modellen te hosten niet betekende dat het een simpele inferentieaanbieder werd, een bedrijf dat alleen de modellen van andere ontwikkelaars draait. Met Le Chonk betoogt Mistral dat het nog altijd moet worden gerekend tot de frontier-labs die hun eigen toonaangevende modellen trainen.
Het grotere plaatje
Voor wie de race om open modellen volgt, is ML4 een directe uitdaging aan het idee dat serieuze open-weight-modellen tegenwoordig vooral uit China komen. Amerikaanse start-ups zetten vergelijkbare stappen, zoals te zien is aan het Beam-model van Reflection. In Europa heeft ook Aleph Alpha ingezet op open-weight-releases voor zakelijke gebruikers, wat erop wijst dat er in de regio een alternatief voor Amerikaanse en Chinese labs vorm begint te krijgen.
De wachttijd van drie weken voordat de gewichten worden vrijgegeven, kan weleens het belangrijkste deel van de lancering blijken. Recente resultaten laten zien dat open modellen steeds beter worden in offensieve beveiligingstaken. Het plan van Mistral om eerst met overheden te testen voordat het publiceert, zou een sjabloon kunnen worden voor hoe grote open modellen worden uitgebracht.
Drie dingen zijn het volgen waard. Ten eerste of onafhankelijke benchmarks de claim van Mistral ondersteunen dat het model de beste in zijn klasse is. Ten tweede of de gewichten daadwerkelijk op tijd verschijnen. Ten derde of ML4 nuttig blijkt bij chipontwerp voor partners als ASML en Samsung.
