EmbeddingGemma 2 ist das neue offene Modell von Google DeepMind für lokale semantische Suche. In einem Beitrag vom 6. Oktober 2026 beschreiben die Research Engineers Sahil Dua und Henrique Schechter Vera ein Modell mit 740 Millionen Parametern unter der Apache-2.0-Lizenz, das Text, Code, Bild, Audio und Video in denselben Vektorraum legt.
Was ist passiert?
Embeddings sind Zahlenlisten, die den Sinn eines Inhalts abbilden. Ähnliche Inhalte liegen nah beieinander, sodass eine App aus einem Satz einen Videoclip oder aus einem Bild eine Audiodatei finden kann, ohne Server. Die Ankündigung steht im Google-Blog, die Doku unter ai.google.dev/gemma/docs/embeddinggemma.
Das vorherige EmbeddingGemma war nur Text und überschritt laut Google 20 Millionen Downloads. Version 2 basiert auf der Gemma-4-Architektur und erweitert den Kontext auf 8.192 Tokens, das Vierfache des ersten Modells. Google sagt, das Fenster decke bis zu 5,5 Minuten Audio, 29 Bilder oder 58 Videoframes in einem Aufruf ab.
Warum das wichtig ist
Das Design von EmbeddingGemma 2 ist modular. Der Textkern hat 270 Millionen Parameter. Bild und Audio sind optionale Encoder mit 170 und 300 Millionen. Auf einem Pixel 11 Pro mit Quantisierung nennt Google etwa 191 MB aktiven RAM nur für Text und etwa 567 MB für das volle multimodale Modell. Die Standardausgabe hat 768 Dimensionen, Matryoshka-Training erlaubt aber 512, 256 oder 128, mit bis zu sechsfach weniger Speicher und kleinem Qualitätsverlust, so das Unternehmen.
Auf MTEB Code meldet Google einen Sprung von 68,76 auf 78,68 gegenüber EmbeddingGemma 1, plus 9,92 Punkte. Es sagt auch, das Modell führe unter multimodalen Embeddern mit weniger als einer Milliarde Parametern in Tests wie MTEB Code und MAEB und schlage manche Spezialisten mit mehr als doppelter Größe. Die Zahlen stammen von Google, nicht von einem unabhängigen Audit.
Was ändert sich in der Praxis?
Für Entwickler heißt das: Code, Fotos, Audio und Video auf dem Gerät indizieren und RAG bauen — Passagen holen, bevor eine Antwort entsteht — ohne Datei-Upload. Google zeigt das Modell in der AI Edge Gallery für Mediensuche und Video-Momente und sagt, EmbeddingGemma 2 teile Text-Tokenizer und Audio-Encoder mit Gemma 4, was den Speicher senkt, wenn beide zusammen laufen.
- Gewichte auf Hugging Face und Kaggle;
- Builds für Ollama, llama.cpp, vLLM, MLX, SGLang und LM Studio;
- Browser-Demo über WebGPU und transformers.js;
- Fine-Tuning-Anleitung von Unsloth.
Die Apache-2.0-Lizenz erlaubt kommerzielle Nutzung und Fine-Tuning. Der Model Garden der Gemini Enterprise Agent Platform war im Beitrag noch als kommend markiert. Einen API-Preis gibt es nicht, weil das Modell offene Gewichte hat und kein geschlossener Bilddienst ist.
Bildnachweis: Google DeepMind — Quelle: offizieller Google-Blog
Von GeekikiBot