Mistral Large 4: un billón de parámetros contra sus rivales
El laboratorio francés de IA Mistral AI lanzó el martes Mistral Large 4 (ML4). Se trata de un gran modelo multimodal, es decir, capaz de procesar más de un tipo de entrada, y Mistral quiere que compita tanto con los laboratorios estadounidenses como con los chinos. El lanzamiento demuestra también que Europa sigue decidida a competir en la élite del desarrollo de la IA.
Mistral enmarca el lanzamiento en una idea que el presidente francés, Emmanuel Macron, ha bautizado como "una tercera vía en la IA". El mercado está cada vez más dividido entre los modelos cerrados, que sus propietarios pueden desactivar cuando quieran, y los modelos abiertos, muchos de los cuales proceden de China. Mistral presenta ML4 como una alternativa a ambos.
Un billón de parámetros, con los pesos aún por llegar
ML4 tiene un billón de parámetros, lo que explica su apodo interno: Le Chonk. Sin embargo, todavía no es un modelo de pesos abiertos. Que un modelo sea "de pesos abiertos" significa que se publican los parámetros del modelo entrenado para que cualquiera pueda descargarlos, ejecutarlos y examinarlos.
Por ahora, la única forma de usar ML4 es a través de un endpoint público con salvaguardas. Mistral asegura que publicará los pesos dentro de tres semanas, cuando concluyan las pruebas de seguridad.
Pierre Stock, vicepresidente de Ciencia de Mistral, explicó a TechCrunch que la compañía dedicará ese tiempo a trabajar "con socios de confianza y gobiernos para garantizar que los pesos de código abierto puedan usarse para defenderse, pero no para [lanzar] ataques maliciosos".
Este despliegue escalonado responde a una creciente preocupación por la seguridad. Según Stock, esa inquietud ha aumentado en los últimos meses, sobre todo entre empresas e instituciones, que son los principales clientes de Mistral. Stock defendió además que los pesos abiertos aportan una ventaja de seguridad propia, porque un modelo abierto es más fácil de auditar.
Entrenado con menos GPU
Mistral entrenó ML4 íntegramente con su propia capacidad de cómputo, utilizando 4.000 GPU de Nvidia. Según Stock, es "entre dos y tres veces menos que nuestros competidores chinos, y bastante menos que los competidores de código cerrado".
La cifra no es menor. Indica que Mistral presenta la eficiencia, y no la escala bruta, como su baza frente a rivales con mucho más hardware.
Dónde espera ganar Mistral con ML4
Aún no se han publicado los resultados de las pruebas de rendimiento, así que ninguna de las afirmaciones sobre su desempeño está verificada. Stock señaló que Mistral aspira a que ML4 sea el mejor modelo de pesos abiertos disponible, especialmente fuera de China, aunque no limitó esa ambición a ese mercado.
La compañía también apunta a sectores concretos. Gracias a un entrenamiento focalizado, Mistral cree que ML4 podría superar a los modelos cerrados en los ámbitos que más importan a sus clientes, sobre todo donde las capacidades multimodales resultan útiles. Stock citó tres casos de uso prioritarios:
- Ciberseguridad
- Finanzas
- Diseño de chips
El diseño de chips enlaza directamente con los inversores de Mistral. El fabricante neerlandés de equipos para chips ASML lideró la ronda de Serie C de Mistral. Samsung encabezó el mes pasado su Serie D, que valoró la compañía en 21.000 millones de euros (unos 24.390 millones de dólares).
Algo más que un proveedor de inferencia
También hay una cuestión de posicionamiento. Coincidiendo con su última ronda de financiación, Mistral aclaró que su decisión de alojar modelos chinos no significaba que fuera a convertirse en un simple proveedor de inferencia, es decir, una empresa que se limita a ejecutar modelos de otros desarrolladores. Con Le Chonk, Mistral defiende que se la siga considerando un laboratorio de frontera que entrena sus propios modelos punteros.
El contexto general
Para quienes siguen la carrera de los modelos abiertos, ML4 supone un desafío directo a la idea de que los modelos de pesos abiertos serios vienen ahora sobre todo de China. Las startups estadounidenses están dando pasos parecidos, como se ha visto con el modelo Beam de Reflection. En Europa, Aleph Alpha también ha apostado por lanzamientos de pesos abiertos dirigidos a empresas, lo que apunta a que empieza a tomar forma en la región una alternativa a los laboratorios estadounidenses y chinos.
El plazo de tres semanas antes de liberar los pesos podría acabar siendo lo más relevante del lanzamiento. Los resultados recientes muestran que los modelos abiertos son cada vez más capaces en tareas de seguridad ofensiva. El plan de Mistral de hacer pruebas con gobiernos antes de la publicación podría convertirse en un modelo a seguir para el lanzamiento de grandes modelos abiertos.
Hay tres cosas a las que conviene estar atentos. Primero, si las pruebas independientes respaldan las afirmaciones de Mistral de ser el mejor de su categoría. Segundo, si los pesos se publican realmente en el plazo previsto. Y tercero, si ML4 resulta útil en el diseño de chips para socios como ASML y Samsung.
