时间:2026年10月6日(北美时间)Google DeepMind 官方发布;2026年10月7日(亚洲时间)开发者可下载权重
地点:美国加州山景城 Google DeepMind 总部;同时通过 Hugging Face、Kaggle、Ollama、llama.cpp、LiteRT 全球分发
人物:Sahil Dua(Google DeepMind 研究工程师)、Henrique Schechter Vera(Google DeepMind 研究工程师)
事件详情:Google DeepMind 于 10 月 6 日发布 EmbeddingGemma 2 开源多模态嵌入模型。该模型在初代 EmbeddingGemma(仅文本)基础上扩展至原生支持文本、代码、图像、视频和音频五种输入类型,全部映射到同一个 768 维统一向量空间。模型总参数 740M,由 270M 参数的文本主干(130M Transformer + 140M Embedder)、170M 视觉编码器和 300M 音频编码器三个模块化组件构成,开发者可按需加载部分组件,从而在 270M / 440M / 570M / 740M 四种规模间灵活组合。上下文窗口 8K token,可一次性处理约 29 张图片、58 帧视频或约 5.5 分钟音频。模型采用 Apache 2.0 商业友好许可,权重已同步上架 Hugging Face 与 Kaggle,Ollama、llama.cpp GGUF、LiteRT 构建已上线,vLLM 即将支持。
核心能力:在子 10 亿参数规模的多模态嵌入模型中处于 SOTA。MTEB Code v1 全精度得分 78.68,比上一代 68.76 提升约 14%,专门优化面向编码 Agent 的代码检索场景;MTEB 多语言 v2 得分 61.36 与上一代持平;MIEB lite(图像)64.64、MMEB v2 图像检索 57.28、视觉文档检索 67.84、MAEB 音频任务 49.39。引入 Matryoshka Representation Learning(MRL)技术,向量原生支持 128 / 256 / 512 / 768 维度截断,存储空间最高可缩减 6 倍,在 256 维时多语言 MTEB 仍保持 60.41(768 维为 61.36),质量几乎不受影响。量化感知训练支持 INT4/INT8 量化,在 Pixel 11 Pro 上仅文本模式下激活内存约 191 MB,全模态模式约 567 MB;在 MacBook M5 Pro GPU 上单张图像嵌入约 37.3 毫秒。
背景:上一代 EmbeddingGemma 自 2025 年 9 月发布以来已被开发者下载超过 2000 万次,是 Google 推动"端侧 AI"战略的关键产品之一。EmbeddingGemma 2 直接采用 Gemini Embedding 的同源技术,并与 Gemma 4 共享文本 tokenizer 与音频编码器,因此搭配 Gemma 4 做端侧 RAG 时所需内存显著低于两套独立模型。Google AI Edge 已在 macOS 上的 Foresight 会议应用中实测使用 EmbeddingGemma 2 + Gemma 4 组合,并通过 AI Edge Gallery 演示 Video Moments Finder(通过文本或语音查询定位视频场景)。
影响:EmbeddingGemma 2 把多模态检索从云端拉到端侧,使手机、笔记本等消费级设备无需联网即可完成"语音片段查视频""文本查图片"等跨模态搜索,同时满足隐私合规与低延迟需求;对开发者生态而言,Apache 2.0 许可 + vLLM/Ollama/LiteRT 全栈支持显著降低构建本地 RAG、检索增强代理、跨模态分类系统的工程门槛;模型本身将与 Gemini Embedding 系列形成云端 + 端侧的完整覆盖,进一步削弱专有嵌入 API 的护城河。
总结:EmbeddingGemma 2 通过模块化设计、Apache 2.0 许可与 MRL 截断机制,把 740M 参数的多模态嵌入模型塞进了 200MB 量级的内存预算,为端侧 RAG 与跨模态检索提供了当前最实用的开源底座,延续了 Google 把 Gemini Embedding 技术下沉到端侧的开放路线。
参考来源:
1. Google DeepMind 官方博客:https://deepmind.google/blog/embeddinggemma-2-an-open-lightweight-multimodal-embedding-model/
2. Google Blog(开发者工具):https://blog.google/technology/developers-tools/embeddinggemma-2/
3. Hugging Face 模型页:https://huggingface.co/google/embeddinggemma-2-1b
4. Ollama 模型库:https://ollama.com/library/embeddinggemma-2
5. Google AI Edge 文档:https://ai.google.dev/edge/mediapipe/solutions/text/embeddings
6. SiliconANGLE:https://siliconangle.com/2026/10/06/google-expands-embeddinggemma-beyond-text-to-images-audio-and-video/
7. Meta Ai Labs 解读:https://www.metaailabs.com/google-deepmind-releases-embeddinggemma-2-a-740m-open-multimodal-embedding-model-built-on-gemma-4
8. Devlery 技术分析:https://devlery.com/en/blog/embeddinggemma-2-multimodal-on-device
9. Artiverse 报道:https://www.artiverse.ca/deepminds-new-embedding-model-unifies-five-data-types







