热门AI工具推荐

焚书AI多模型聚合平台
AI多模型聚合平台( Claude 系列、GPT 系列)支持聊天、搜索、图片、视频、音乐等多种功能;聚合了 Claude 系列(如 Sonnet 5、Opus 5 等)、Gemini 系列、GPT 系列、DeepSeek(搜索模式默认调用 DeepSeek V4 Pro)以及通义千问、Kimi 等数十款国内外主流模型。
AI编程订阅服务,支持多款国产主流编程模型自由切换。
Seedance 2.0AI视频生成
具备卓越的物理真实性和角色一致性,可生成电影级视频内容。
方舟 Agent PlanAI智能体订阅
火山引擎推出的全场景AI智能体订阅服务,通过一个订阅整合5大主流模型和10+AI工具
SpeedAIAI内容检测降重
AI内容检测与降重工具,能有效帮助用户通过论文AI率检测
秒哒AI工具
不懂代码也能开发应用?百度秒哒:无需编程,快速搭建小程序与网站
有戏AIAI漫剧生成工具
全流程AI短剧创作工具,实现从剧本到成片的自动化生产,让“一人即剧组”成为现实。
沁言学术智能科研平台
一站式文献管理与科研写作工具,支持边写作边搜索文献,高效阅读,文献管理,

Google开源EmbeddingGemma 2:740M参数统一多模态嵌入模型

时间:2026年10月6日(北美时间)Google DeepMind 官方发布;2026年10月7日(亚洲时间)开发者可下载权重 地点:美国加州山景城 Google DeepMind 总部;同时通过 Hugging Face、Kaggle、Ollama、llama.cpp、LiteRT 全球分发 人物:Sahil Dua(Google DeepMind 研究工程师)、Henrique Schechter Vera(Google DeepMind 研究工程师) 事件详情:Google DeepMind 于 10 月 6 日发布 EmbeddingGemma 2 开源多模态嵌入模型。该模型在初代 EmbeddingGemma(仅文本)基础上扩展至原生支持文本、代码、图像、视频和音频五种输入类型,全部映射到同一个 768 维统一向量空间。模型总参数 740M,由 270M 参数的文本主干(130M Transformer + 140M Embedder)、170M 视觉编码器和 300M 音频编码器三个模块化组件构成,开发者可按需加载部分组件,从而在 270M / 440M / 570M / 740M 四种规模间灵活组合。上下文窗口 8K token,可一次性处理约 29 张图片、58 帧视频或约 5.5 分钟音频。模型采用 Apache 2.0 商业友好许可,权重已同步上架 Hugging Face 与 Kaggle,Ollama、llama.cpp GGUF、LiteRT 构建已上线,vLLM 即将支持。 核心能力:在子 10 亿参数规模的多模态嵌入模型中处于 SOTA。MTEB Code v1 全精度得分 78.68,比上一代 68.76 提升约 14%,专门优化面向编码 Agent 的代码检索场景;MTEB 多语言 v2 得分 61.36 与上一代持平;MIEB lite(图像)64.64、MMEB v2 图像检索 57.28、视觉文档检索 67.84、MAEB 音频任务 49.39。引入 Matryoshka Representation Learning(MRL)技术,向量原生支持 128 / 256 / 512 / 768 维度截断,存储空间最高可缩减 6 倍,在 256 维时多语言 MTEB 仍保持 60.41(768 维为 61.36),质量几乎不受影响。量化感知训练支持 INT4/INT8 量化,在 Pixel 11 Pro 上仅文本模式下激活内存约 191 MB,全模态模式约 567 MB;在 MacBook M5 Pro GPU 上单张图像嵌入约 37.3 毫秒。 背景:上一代 EmbeddingGemma 自 2025 年 9 月发布以来已被开发者下载超过 2000 万次,是 Google 推动"端侧 AI"战略的关键产品之一。EmbeddingGemma 2 直接采用 Gemini Embedding 的同源技术,并与 Gemma 4 共享文本 tokenizer 与音频编码器,因此搭配 Gemma 4 做端侧 RAG 时所需内存显著低于两套独立模型。Google AI Edge 已在 macOS 上的 Foresight 会议应用中实测使用 EmbeddingGemma 2 + Gemma 4 组合,并通过 AI Edge Gallery 演示 Video Moments Finder(通过文本或语音查询定位视频场景)。 影响:EmbeddingGemma 2 把多模态检索从云端拉到端侧,使手机、笔记本等消费级设备无需联网即可完成"语音片段查视频""文本查图片"等跨模态搜索,同时满足隐私合规与低延迟需求;对开发者生态而言,Apache 2.0 许可 + vLLM/Ollama/LiteRT 全栈支持显著降低构建本地 RAG、检索增强代理、跨模态分类系统的工程门槛;模型本身将与 Gemini Embedding 系列形成云端 + 端侧的完整覆盖,进一步削弱专有嵌入 API 的护城河。 总结:EmbeddingGemma 2 通过模块化设计、Apache 2.0 许可与 MRL 截断机制,把 740M 参数的多模态嵌入模型塞进了 200MB 量级的内存预算,为端侧 RAG 与跨模态检索提供了当前最实用的开源底座,延续了 Google 把 Gemini Embedding 技术下沉到端侧的开放路线。 参考来源: 1. Google DeepMind 官方博客:https://deepmind.google/blog/embeddinggemma-2-an-open-lightweight-multimodal-embedding-model/ 2. Google Blog(开发者工具):https://blog.google/technology/developers-tools/embeddinggemma-2/ 3. Hugging Face 模型页:https://huggingface.co/google/embeddinggemma-2-1b 4. Ollama 模型库:https://ollama.com/library/embeddinggemma-2 5. Google AI Edge 文档:https://ai.google.dev/edge/mediapipe/solutions/text/embeddings 6. SiliconANGLE:https://siliconangle.com/2026/10/06/google-expands-embeddinggemma-beyond-text-to-images-audio-and-video/ 7. Meta Ai Labs 解读:https://www.metaailabs.com/google-deepmind-releases-embeddinggemma-2-a-740m-open-multimodal-embedding-model-built-on-gemma-4 8. Devlery 技术分析:https://devlery.com/en/blog/embeddinggemma-2-multimodal-on-device 9. Artiverse 报道:https://www.artiverse.ca/deepminds-new-embedding-model-unifies-five-data-types