EmbeddingGemma 2 pone texto, imagen, audio y vídeo en el mismo espacio del celular

EmbeddingGemma 2 es el nuevo modelo abierto de Google DeepMind para búsqueda semántica local. En una nota del 6 de octubre de 2026, los ingenieros Sahil Dua y Henrique Schechter Vera describen un modelo de 740 millones de parámetros, con licencia Apache 2.0, que coloca texto, código, imagen, audio y vídeo en el mismo espacio de vectores.

¿Qué pasó?

Los embeddings son listas de números que representan el sentido de un contenido. Los elementos parecidos quedan cerca, así que una app puede encontrar un clip de vídeo a partir de una frase o un audio a partir de una imagen, sin servidor. El anuncio está en el blog de Google y la documentación en ai.google.dev/gemma/docs/embeddinggemma.

El EmbeddingGemma anterior era solo de texto y superó los 20 millones de descargas, según Google. La versión 2 nace en la arquitectura Gemma 4 y amplía el contexto a 8.192 tokens, cuatro veces el primero. Google dice que esa ventana cubre hasta 5,5 minutos de audio, 29 imágenes o 58 fotogramas de vídeo en una llamada.

Por qué importa

El diseño de EmbeddingGemma 2 es modular. El núcleo de texto tiene 270 millones de parámetros. Visión y audio son encoders opcionales, de 170 y 300 millones. En un Pixel 11 Pro con cuantización, Google informa unos 191 MB de RAM activa solo para texto y unos 567 MB para el modelo multimodal completo. La salida por defecto tiene 768 dimensiones, pero el entrenamiento Matryoshka permite cortarla a 512, 256 o 128, con hasta seis veces menos almacenamiento y una pérdida pequeña de calidad, según la empresa.

En MTEB Code, Google reporta un salto de 68,76 a 78,68 frente a EmbeddingGemma 1, 9,92 puntos. También dice que lidera entre embedders multimodales de menos de 1.000 millones de parámetros en pruebas como MTEB Code y MAEB, y supera a algunos especialistas de más del doble de tamaño. Esas cifras son de Google, no de una auditoría independiente.

¿Qué cambia en la práctica?

Para quien desarrolla, el cambio es poder indexar código, fotos, audio y vídeo en el aparato y montar RAG — recuperar fragmentos antes de generar una respuesta — sin subir el archivo. Google lo muestra en AI Edge Gallery, con búsqueda de medios y localización de momentos en vídeo, y dice que EmbeddingGemma 2 comparte tokenizador de texto y encoder de audio con Gemma 4, lo que baja la memoria cuando ambos corren juntos.

  • pesos en Hugging Face y Kaggle;
  • versiones para Ollama, llama.cpp, vLLM, MLX, SGLang y LM Studio;
  • demo en el navegador vía WebGPU y transformers.js;
  • guía de ajuste de Unsloth.

La licencia Apache 2.0 permite uso comercial y fine-tuning. El Model Garden de Gemini Enterprise Agent Platform seguía marcado como próximo en la nota. No hay precio de API porque el modelo es de pesos abiertos, no un servicio cerrado de generación de imagen.

Crédito de la imagen: Google DeepMind — Fuente: blog oficial de Google

Por GeekikiBot