Google startet Nano Banana 2.1 und EmbeddingGemma 2 am selben Tag

Google machte den 6. Oktober 2026 zu einem Tag mit zwei sich ergänzenden KI-Starts. Auf der einen Seite erreicht das Bildmodell Nano Banana 2.1 die Produkte des Unternehmens. Auf der anderen öffnet EmbeddingGemma 2 ein leichtes Modell unter Apache-2.0-Lizenz für multimodale Suche auf dem Gerät.

Was sich bei Nano Banana 2.1 ändert

Auf dem offiziellen Konto beschrieb Google Nano Banana 2.1 als die neueste Version für Bilderzeugung und -bearbeitung, mit Fortschritten bei visuellem Design, maskenbasierter Bearbeitung und Motivkonsistenz. Das Unternehmen teilte mit, die Verteilung beginne am selben Tag in der Gemini-App, im AI Mode der Suche, in Google AI Studio, Flow, Stitch, Google Ads und auf der Gemini Enterprise Platform.

Die Modellkarte von DeepMind ordnet Nano Banana 2.1 der Gemini-3-Familie zu und beschreibt es als auf Gemini 3.6 Flash basierend. Sie nennt Text- und Bildeingabe mit einem Fenster von bis zu 1 Million Tokens, Bildausgabe bis 4.000 Tokens und Textausgabe bis 64.000 Tokens.

In internen Bewertungen vom Oktober 2026 erzielt die Variante mit Reasoning 1050 Punkte bei der allgemeinen Text-zu-Bild-Präferenz, gegenüber 990 für Nano Banana 2 (Gemini 3.1 Flash Image) und 935 für Nano Banana Pro. Bei Masken- oder Skizzenbearbeitung erreicht derselbe Modus 1049, über den 965 und 927 der in der Tabelle genannten Vorgänger. Google nennt auch Grenzen: kleiner Text kann unscharf bleiben, die Figurenkonsistenz ist nicht perfekt, und die räumliche Zuordnung scheitert gelegentlich.

EmbeddingGemma 2, die andere Ankündigung

In einem separaten Beitrag bestätigte Google, dass EmbeddingGemma 2 auf Hugging Face und Kaggle herunterladbar ist und bald im Model Garden der Gemini Enterprise Agent Platform folgt. Der Blog von DeepMind-Forschern Sahil Dua und Henrique Schechter Vera nennt es das fähigste Modell des Unternehmens für multimodale Embeddings auf dem Gerät.

EmbeddingGemma 2 hat 740 Millionen Parameter, eine an Gemma 4 geknüpfte Architektur und bildet Text, Code, Bild, Audio und Video in einem gemeinsamen Raum ab. Google gibt an, der reine Text-Vorgänger habe mehr als 20 Millionen Downloads überschritten. Die neue Version erweitert den Kontext auf 8.000 Tokens, das Vierfache von EmbeddingGemma, laut Unternehmen genug für bis zu 5,5 Minuten Audio, 29 Bilder oder 58 Videoframes.

Das Design ist modular: rund 270 Millionen Parameter genügen für Text, mit optionalen Encodern für Bild (170 Millionen) und Audio (300 Millionen). Mit Matryoshka lassen sich 768-dimensionale Vektoren bis auf 128 kürzen, was Google mit bis zu sechsfach weniger Speicher verbindet. Auf einem Pixel 11 Pro nennt das Unternehmen nach Quantisierung etwa 191 MB aktiven RAM für reine Textgewichte und etwa 567 MB für das volle multimodale Modell.

Bei MTEB Code steigt der Wert von 68,76 auf 78,68. Die Gewichte liegen auf Hugging Face und Kaggle, mit genannter Unterstützung für transformers, sentence-transformers, llama.cpp, Ollama und LM Studio.

Warum die beiden Ankündigungen zusammengehören

Es sind nicht dieselben Produkte. Nano Banana 2.1 erzeugt und bearbeitet Bilder in Google-Diensten. EmbeddingGemma 2 organisiert und findet Medien lokal und ersetzt keinen Bildgenerator. Zusammen zeigen sie aber die Linie des Tages: ein geschlossenes Modell in den Apps und ein offenes Modell für Suche und RAG auf dem Gerät.

Die öffentliche Ankündigung nennt keinen eigenen Preis für Nano Banana 2.1 und keinen genauen Model-Garden-Termin für EmbeddingGemma 2. Google sagt nur, die Verfügbarkeit auf dieser Plattform folge.

Quellen

Transparenz: Dieser Inhalt wurde mit Hilfe künstlicher Intelligenz erstellt, bearbeitet oder geprüft. Die Angaben wurden mit öffentlichen Beiträgen auf X und Quellen im Internet abgeglichen. Prüfen Sie die Originalquellen für den vollständigen Kontext.

Por GeekikiBot