Google a fait du 6 octobre 2026 une journée de deux lancements d'intelligence artificielle qui se complètent. D'un côté, le modèle d'image Nano Banana 2.1 commence à arriver dans les produits de l'entreprise. De l'autre, EmbeddingGemma 2 ouvre un modèle léger sous licence Apache 2.0 pour la recherche multimodale sur l'appareil.
Ce qui change dans Nano Banana 2.1
Sur son compte officiel, Google décrit Nano Banana 2.1 comme la dernière version de génération et d'édition d'images, avec des progrès en design visuel, en édition par masque et en cohérence du sujet. L'entreprise indique que la distribution commence le jour même dans l'app Gemini, AI Mode de la Recherche, Google AI Studio, Flow, Stitch, Google Ads et Gemini Enterprise Platform.
La fiche DeepMind place Nano Banana 2.1 dans la famille Gemini 3 et le décrit comme fondé sur Gemini 3.6 Flash. Elle indique une entrée texte et image avec une fenêtre allant jusqu'à 1 million de tokens, une sortie image jusqu'à 4 000 tokens et une sortie texte jusqu'à 64 000 tokens.
Dans les évaluations internes d'octobre 2026, la variante avec raisonnement marque 1050 en préférence générale texte-vers-image, contre 990 pour Nano Banana 2 (Gemini 3.1 Flash Image) et 935 pour Nano Banana Pro. En édition par masque ou dessin, le même mode atteint 1049, au-dessus des 965 et 927 des générations citées. Google note aussi des limites : le petit texte peut rester flou, la cohérence des personnages n'est pas parfaite et la localisation spatiale échoue parfois.
EmbeddingGemma 2, l'autre annonce
Dans un autre message, Google confirme qu'EmbeddingGemma 2 est téléchargeable sur Hugging Face et Kaggle, avec une arrivée prévue dans le Model Garden de Gemini Enterprise Agent Platform. Le billet, signé par Sahil Dua et Henrique Schechter Vera, de DeepMind, le présente comme le modèle le plus capable de l'entreprise pour les embeddings multimodaux sur appareil.
EmbeddingGemma 2 compte 740 millions de paramètres, une architecture liée à Gemma 4, et cartographie texte, code, image, audio et vidéo dans un espace commun. Google affirme que le prédécesseur texte a dépassé 20 millions de téléchargements. La nouvelle version porte le contexte à 8 000 tokens, quatre fois EmbeddingGemma, de quoi, selon l'entreprise, couvrir jusqu'à 5,5 minutes d'audio, 29 images ou 58 images vidéo.
La conception est modulaire : environ 270 millions de paramètres suffisent pour le texte, avec des encodeurs optionnels de vision (170 millions) et d'audio (300 millions). Avec Matryoshka, les vecteurs de 768 dimensions peuvent être réduits à 128, ce que Google associe à une baisse de stockage jusqu'à six fois. Sur un Pixel 11 Pro, l'entreprise cite environ 191 Mo de RAM active pour les poids texte seuls et environ 567 Mo pour le modèle multimodal complet après quantification.
Sur MTEB Code, le bond annoncé va de 68,76 à 78,68. Les poids sont sur Hugging Face et Kaggle, avec un soutien cité pour transformers, sentence-transformers, llama.cpp, Ollama et LM Studio.
Pourquoi les deux annonces se répondent
Ce ne sont pas le même produit. Nano Banana 2.1 génère et édite des images dans les services Google. EmbeddingGemma 2 organise et retrouve des médias en local et ne remplace pas un générateur d'images. Ensemble, ils montrent toutefois la stratégie du jour : un modèle fermé distribué dans les apps, et un modèle ouvert pensé pour la recherche et le RAG sur l'appareil.
L'annonce publique ne détaille pas un prix séparé pour Nano Banana 2.1 ni le calendrier exact du Model Garden pour EmbeddingGemma 2. Google dit seulement que la disponibilité sur cette plateforme arrive ensuite.
Sources
- Publication Google sur Nano Banana 2.1
- Publication Google sur EmbeddingGemma 2
- Fiche modèle Nano Banana 2.1
- Blog officiel d'EmbeddingGemma 2
Transparence : Ce contenu a été créé, édité ou relu avec l'aide de l'intelligence artificielle. Les informations ont été croisées avec des publications publiques sur X et des sources disponibles sur internet. Consultez les sources originales pour le contexte complet.
Por GeekikiBot