Mistral Large 4 : "Le Chonk", 1 000 milliards de paramètres

Le laboratoire français d'IA Mistral AI a dévoilé mardi Mistral Large 4 (ML4). Il s'agit d'un grand modèle multimodal, capable de traiter plusieurs types d'entrées, que Mistral veut opposer aux laboratoires américains comme chinois. Ce lancement montre aussi que l'Europe compte bien rester dans la course au plus haut niveau du développement de l'IA.

Mistral inscrit ce lancement dans une idée que le président de la République Emmanuel Macron a baptisée "une troisième voie dans l'IA". Le marché se divise de plus en plus entre les modèles fermés, que leurs propriétaires peuvent couper à tout moment, et les modèles ouverts, dont beaucoup viennent de Chine. Mistral présente ML4 comme une alternative aux deux.

Mille milliards de paramètres, des poids encore à venir

ML4 compte 1 000 milliards de paramètres, d'où son surnom en interne, Le Chonk. Ce n'est toutefois pas encore un modèle à poids ouverts. On parle de "poids ouverts" lorsque les paramètres du modèle entraîné sont publiés pour que chacun puisse les télécharger, les exécuter et les examiner.

Pour l'instant, ML4 n'est accessible que via un point d'accès public doté de garde-fous. Mistral affirme qu'il publiera les poids dans trois semaines, une fois les tests de sécurité terminés.

Pierre Stock, VP Science de Mistral, a expliqué à TechCrunch que l'entreprise mettra ce délai à profit pour travailler "avec des partenaires de confiance et des gouvernements afin de s'assurer que les poids open source puissent servir à se défendre, mais pas à [mener] des attaques malveillantes".

Ce déploiement par étapes reflète des inquiétudes croissantes en matière de sécurité. Selon Pierre Stock, ces préoccupations se sont accentuées ces derniers mois, en particulier chez les entreprises et les institutions, qui constituent le coeur de la clientèle de Mistral. Il fait aussi valoir que les poids ouverts présentent un avantage propre en matière de sécurité, puisqu'un modèle ouvert est plus facile à auditer.

Un entraînement avec moins de GPU

Mistral a entraîné ML4 entièrement sur sa propre puissance de calcul, avec 4 000 GPU Nvidia. Selon Pierre Stock, c'est "deux à trois fois moins que nos concurrents chinois, et nettement moins que les concurrents propriétaires".

Ce chiffre a son importance. Il laisse entendre que Mistral mise sur l'efficacité, plutôt que sur la puissance brute, pour se démarquer face à des rivaux bien mieux équipés en matériel.

Là où Mistral compte s'imposer

Aucun résultat de benchmark n'a encore été publié, si bien que toutes les promesses de performances restent à vérifier. Pierre Stock indique que Mistral espère faire de ML4 le meilleur modèle à poids ouverts disponible, surtout hors de Chine, sans pour autant limiter cette ambition à ce marché.

L'entreprise vise aussi des domaines précis. Grâce à un entraînement ciblé, Mistral estime que ML4 pourrait surpasser les modèles fermés dans les secteurs qui comptent le plus pour ses clients, notamment là où les capacités multimodales sont utiles. Pierre Stock cite trois cas d'usage prioritaires :

  • La cybersécurité
  • La finance
  • La conception de puces

La conception de puces renvoie directement aux investisseurs de Mistral. Le fabricant néerlandais d'équipements pour semi-conducteurs ASML a mené la série C de Mistral. Samsung a mené sa série D le mois dernier, qui a valorisé l'entreprise à 21 milliards d'euros (environ 24,39 milliards de dollars).

Plus qu'un fournisseur d'inférence

Il y a aussi une question de positionnement. Lors de sa dernière levée de fonds, Mistral avait assuré que sa décision d'héberger des modèles chinois ne faisait pas de lui un simple fournisseur d'inférence, c'est-à-dire une entreprise qui se contente de faire tourner les modèles d'autres développeurs. Avec Le Chonk, Mistral entend montrer qu'il reste un laboratoire de pointe, qui entraîne ses propres modèles de premier plan.

La vue d'ensemble

Pour ceux qui suivent la course aux modèles ouverts, ML4 remet frontalement en cause l'idée que les modèles à poids ouverts sérieux viennent désormais surtout de Chine. Des start-up américaines font des choix similaires, comme l'illustre le modèle Beam de Reflection. En Europe, Aleph Alpha a lui aussi misé sur des modèles à poids ouverts destinés aux entreprises, signe qu'une alternative aux laboratoires américains et chinois commence à prendre forme sur le continent.

Le délai de trois semaines avant la publication des poids pourrait finalement s'avérer l'aspect le plus marquant de ce lancement. Des résultats récents montrent que les modèles ouverts progressent dans les tâches de sécurité offensive. La démarche de Mistral, qui consiste à tester avec des gouvernements avant de publier, pourrait devenir un modèle pour la diffusion des grands modèles ouverts.

Trois points sont à surveiller. D'abord, si des benchmarks indépendants confirment que Mistral fait mieux que la concurrence, comme il l'affirme. Ensuite, si les poids sont bien publiés dans les délais annoncés. Enfin, si ML4 se révèle utile pour la conception de puces chez des partenaires comme ASML et Samsung.