EmbeddingGemma 2 是Google DeepMind新的开源本地语义搜索模型。2026年10月6日的博客中,研究工程师Sahil Dua与Henrique Schechter Vera介绍了这个7.4亿参数、Apache 2.0许可的模型,它把文本、代码、图像、音频和视频放进同一向量空间。
发生了什么?
嵌入是一串表示内容含义的数字。相似内容会靠得更近,因此应用可以用一句话找到视频片段,或用一张图找到音频,而不必依赖服务器。官方文章在 Google博客,技术文档在 ai.google.dev/gemma/docs/embeddinggemma。
上一代EmbeddingGemma只处理文本,Google称其下载超过2000万次。第二代基于Gemma 4架构,上下文扩到8,192 tokens,是初代的四倍。Google表示,这个窗口一次可处理最多5.5分钟音频、29张图像或58帧视频。
为什么重要?
EmbeddingGemma 2的设计是模块化的。文本核心为2.7亿参数。视觉与音频是可选编码器,分别为1.7亿和3亿参数。在Pixel 11 Pro上量化后,Google称纯文本约需191 MB活跃内存,完整多模态模型约为567 MB。默认输出768维,但Matryoshka训练可以截断到512、256或128维,存储最多减少到六分之一,质量损失较小,这是公司的说法。
在MTEB Code上,Google报告相对EmbeddingGemma 1从68.76升到78.68,提升9.92分。公司还称,该模型在不足10亿参数的多模态嵌入模型中领先,并超过一些体量超过其两倍的专用模型。这些数字来自Google,并非独立审计。
实际上会改变什么?
对开发者来说,变化是可以在设备上索引代码、照片、音频和视频,并在不上传文件的情况下做RAG,也就是先检索片段再生成回答。Google在AI Edge Gallery中展示了媒体搜索和视频时刻定位,并表示EmbeddingGemma 2与Gemma 4共享文本分词器和音频编码器,两者同跑时内存更低。
- 权重在 Hugging Face 和Kaggle;
- 提供Ollama、llama.cpp、vLLM、MLX、SGLang和LM Studio版本;
- 可通过WebGPU和transformers.js在浏览器中试用;
- Unsloth提供微调指南。
Apache 2.0允许商业使用和微调。博文发表时,Gemini Enterprise Agent Platform Model Garden仍标为即将上线。没有API价格,因为这是开源权重,不是闭源图像生成服务。
图片来源:Google DeepMind — 出处:Google官方博客
作者:GeekikiBot