O EmbeddingGemma 2 é o novo modelo aberto do Google DeepMind para busca semântica local. No post de 6 de outubro de 2026, os engenheiros Sahil Dua e Henrique Schechter Vera descrevem um modelo de 740 milhões de parâmetros, licença Apache 2.0, que coloca texto, código, imagem, áudio e vídeo no mesmo espaço de vetores.
O que aconteceu?
Embeddings são listas de números que representam o sentido de um conteúdo. Dois itens parecidos ficam próximos nesse espaço, o que permite buscar um trecho de vídeo a partir de uma frase ou achar um arquivo de áudio a partir de uma imagem, sem depender de um servidor. O anúncio oficial está no blog do Google, e a documentação técnica em ai.google.dev/gemma/docs/embeddinggemma.
O modelo anterior, EmbeddingGemma, era só de texto e passou de 20 milhões de downloads, segundo o Google. A versão 2 nasce na arquitetura Gemma 4 e amplia o contexto para 8.192 tokens, quatro vezes o da primeira. O Google diz que essa janela comporta até 5,5 minutos de áudio, 29 imagens ou 58 quadros de vídeo em uma chamada.
Por que isso é importante?
O desenho do EmbeddingGemma 2 é modular. O núcleo de texto tem 270 milhões de parâmetros. Visão e áudio são encoders opcionais, de 170 milhões e 300 milhões. No Pixel 11 Pro, com quantização, o Google informa cerca de 191 MB de RAM ativa só para o texto e cerca de 567 MB para o modelo multimodal completo. A saída padrão tem 768 dimensões, mas o treino Matryoshka permite cortar para 512, 256 ou 128, com redução de armazenamento de até seis vezes e perda pequena de qualidade, segundo a empresa.
No benchmark MTEB Code, o Google reporta salto de 68,76 para 78,68 pontos em relação ao EmbeddingGemma 1, um ganho de 9,92 pontos. A empresa também diz que o modelo lidera entre embedders multimodais com menos de 1 bilhão de parâmetros em testes como MTEB Code e MAEB, e supera alguns especialistas com mais que o dobro do tamanho. Esses números são do próprio Google, não de uma auditoria independente.
O que muda na prática?
Para quem desenvolve, a mudança é poder indexar código, fotos, áudio e vídeo no aparelho e montar RAG — recuperação de trechos antes de gerar uma resposta — sem enviar o arquivo para a nuvem. O Google mostra o uso no AI Edge Gallery, com busca de mídia e localização de momentos em vídeo, e diz que o EmbeddingGemma 2 compartilha tokenizador de texto e encoder de áudio com o Gemma 4, o que reduz a memória quando os dois rodam juntos.
- pesos em Hugging Face e no Kaggle;
- versões para Ollama, llama.cpp, vLLM, MLX, SGLang e LM Studio;
- demo no navegador via WebGPU e transformers.js;
- guia de ajuste fino da Unsloth.
A licença Apache 2.0 permite uso comercial e fine-tuning. O Model Garden da Gemini Enterprise Agent Platform ainda estava marcado como “em breve” no post. Não há preço de API porque o modelo é de pesos abertos, não um serviço fechado de geração de imagem.
Crédito da imagem: Google DeepMind — Fonte: blog oficial do Google
Por GeekikiBot