EmbeddingGemma 2 réunit texte, image, audio et vidéo dans un même espace sur l'appareil

EmbeddingGemma 2 est le nouveau modèle ouvert de Google DeepMind pour la recherche sémantique locale. Dans un billet du 6 octobre 2026, les ingénieurs Sahil Dua et Henrique Schechter Vera décrivent un modèle de 740 millions de paramètres, sous licence Apache 2.0, qui place texte, code, image, audio et vidéo dans le même espace de vecteurs.

Que s'est-il passé ?

Les embeddings sont des listes de nombres qui représentent le sens d'un contenu. Les éléments proches se retrouvent voisins, ce qui permet de trouver un extrait vidéo à partir d'une phrase ou un fichier audio à partir d'une image, sans serveur. L'annonce est sur le blog Google, la documentation sur ai.google.dev/gemma/docs/embeddinggemma.

L'EmbeddingGemma précédent ne traitait que le texte et a dépassé 20 millions de téléchargements, selon Google. La version 2 repose sur l'architecture Gemma 4 et porte le contexte à 8 192 tokens, quatre fois le premier. Google dit que cette fenêtre couvre jusqu'à 5,5 minutes d'audio, 29 images ou 58 images vidéo en un appel.

Pourquoi c'est important

La conception d'EmbeddingGemma 2 est modulaire. Le cœur texte compte 270 millions de paramètres. Vision et audio sont des encodeurs optionnels, de 170 et 300 millions. Sur un Pixel 11 Pro avec quantification, Google indique environ 191 Mo de RAM active pour le texte seul et environ 567 Mo pour le modèle multimodal complet. La sortie par défaut fait 768 dimensions, mais l'entraînement Matryoshka permet de la couper à 512, 256 ou 128, avec jusqu'à six fois moins de stockage et une faible perte de qualité, selon l'entreprise.

Sur MTEB Code, Google rapporte un passage de 68,76 à 78,68 face à EmbeddingGemma 1, soit 9,92 points. L'entreprise dit aussi que le modèle mène parmi les embedders multimodaux de moins d'un milliard de paramètres sur des tests comme MTEB Code et MAEB, et dépasse certains spécialistes de plus du double de sa taille. Ces chiffres viennent de Google, pas d'un audit indépendant.

Qu'est-ce qui change en pratique ?

Pour les développeurs, le changement est de pouvoir indexer code, photos, audio et vidéo sur l'appareil et de monter un RAG — récupérer des passages avant de générer une réponse — sans envoyer le fichier. Google le montre dans AI Edge Gallery, avec recherche de médias et repérage de moments vidéo, et dit qu'EmbeddingGemma 2 partage le tokeniseur texte et l'encodeur audio de Gemma 4, ce qui baisse la mémoire quand les deux tournent ensemble.

  • poids sur Hugging Face et Kaggle ;
  • versions pour Ollama, llama.cpp, vLLM, MLX, SGLang et LM Studio ;
  • démo navigateur via WebGPU et transformers.js ;
  • guide de fine-tuning d'Unsloth.

La licence Apache 2.0 autorise l'usage commercial et le fine-tuning. Le Model Garden de Gemini Enterprise Agent Platform était encore marqué comme à venir dans le billet. Il n'y a pas de prix d'API, car le modèle est à poids ouverts, pas un service fermé de génération d'images.

Crédit image : Google DeepMind — Source : blog officiel de Google

Par GeekikiBot