EmbeddingGemma 2 : Google ajoute images, audio et vidéo

EmbeddingGemma 2 : Google ajoute images, audio et vidéo

Google a publié EmbeddingGemma 2, un modèle d'embeddings ouvert qui traite désormais les images, l'audio et la vidéo en plus du texte. Il reste assez compact pour tourner sur un smartphone.

Un modèle d'embeddings transforme un contenu en une liste de nombres qui en capture le sens. Les éléments similaires se retrouvent proches les uns des autres, et c'est ce qui permet la recherche sémantique et la récupération d'informations. Le premier EmbeddingGemma, présenté en septembre 2025, ne fonctionnait qu'avec du texte. La nouvelle version réunit les quatre types de médias dans un seul et même espace d'embeddings.

Concrètement, une application pourrait partir d'un mémo vocal et retrouver le passage correspondant dans une vidéo, sans qu'aucune de ces données ne quitte le téléphone.

Du texte seul au multimodal

Sahil Dua et Henrique Schechter Vera, ingénieurs de recherche chez Google DeepMind, écrivent dans l'annonce que l'accueil réservé au premier modèle a "largement dépassé nos attentes". Ils évoquent plus de 20 millions de téléchargements.

Le nouveau modèle repose sur l'architecture Gemma 4, lancée par Google en avril. Avec 740 millions de paramètres, il fait plus du double de son prédécesseur. L'essentiel de ce poids supplémentaire se trouve dans les encodeurs de vision et d'audio, dont les applications qui ne traitent que du texte peuvent se passer. Lorsque Google a testé une version quantifiée du seul cœur textuel de 270 millions de paramètres sur un Google Pixel 11 Pro, celle-ci a utilisé environ 191 mégaoctets de mémoire.

La question du stockage

Faire tourner le modèle ne représente qu'une partie du coût. Chaque embedding est une liste de 768 nombres, et chaque photo, extrait ou document indexé ajoute une entrée supplémentaire dans une base de données vectorielle locale.

Google s'appuie sur une méthode d'entraînement baptisée Matryoshka Representation Learning, qui permet aux développeurs de raccourcir ces listes jusqu'à 128 nombres seulement. Le stockage est ainsi divisé jusqu'à six. Selon le guide destiné aux développeurs de Google, avec 256 nombres, la recherche d'images, de vidéos et de parole conserve environ 95 % de sa qualité en pleine longueur.

Benchmarks : le code en tête

C'est sur le code que le progrès est le plus net. EmbeddingGemma 2 obtient 78,68 sur la partie code du Massive Text Embedding Benchmark, soit près de 10 points de plus que la première version. Google vise ici les développeurs qui conçoivent des systèmes de récupération pour des agents de programmation, une communauté qui compte déjà des adeptes des agents de programmation locaux sur des GPU grand public. Les scores sur le texte multilingue, en revanche, ont à peine bougé.

Google revendique aussi les meilleurs résultats parmi les modèles d'embeddings multimodaux de moins d'un milliard de paramètres. Selon l'entreprise, le modèle surpasse sur les tâches d'image, de vidéo et d'audio certains modèles spécialisés plus de deux fois plus gros.

Pensé pour fonctionner avec Gemma 4

EmbeddingGemma 2 utilise le même tokeniseur de texte et le même encodeur audio que Gemma 4. Résultat : un système de génération augmentée par récupération embarqué qui fait tourner les deux modèles consomme moins de mémoire que deux modèles sans lien entre eux.

Google utilise déjà ce duo dans son application de réunion AI Edge Foresight pour Mac. Dans l'application de démonstration AI Edge Gallery, une fonction appelée Video Moments Finder repère une scène dans une vidéo à partir d'une requête tapée ou dictée.

Disponibilité

Les poids sont disponibles dès maintenant sur Hugging Face et sur Kaggle, la plateforme de Google, sous licence Apache 2.0, qui autorise l'usage commercial. Ils fonctionnent déjà avec des outils de déploiement open source comme vLLM, llama.cpp et Ollama. Google a indiqué que le modèle arrivera prochainement dans le Model Garden de Gemini Enterprise Agent Platform.

Pourquoi c'est important

Pour les développeurs, le détail le plus utile est peut-être la conception modulaire. Se passer des encodeurs de vision et d'audio permet de garder des applications textuelles légères, tandis que les composants partagés avec Gemma 4 réduisent la mémoire nécessaire quand les deux modèles sont utilisés ensemble. Cela laisse penser que Google envisage la récupération embarquée comme un ensemble de briques plutôt que comme la sortie d'un modèle isolé.

Cette sortie s'inscrit aussi dans une tendance plus large : celle des modèles ouverts compacts et spécialisés, conçus pour épauler des agents, à l'image du petit modèle de décision d'AWS. Les progrès sur le benchmark de code vont dans le même sens.

Reste à voir si les promesses multimodales résistent à des tests indépendants, et si les développeurs accepteront les compromis de stockage qu'implique l'indexation de grandes bibliothèques de photos et de vidéos sur un téléphone.