N
NeoMME 多模态原生编码器 今日发布
## 产品简介 NeoMME 是 H Company 于 2026 年 9 月 3 日开源的多模态原生多语言编码器家族
产品简介
NeoMME 是 H Company 于 2026 年 9 月 3 日开源的多模态原生多语言编码器家族,包含 NeoMME-260M 和 NeoMME-800M 两款模型,参数分别为 2.6 亿和 8 亿。NeoMME 的核心创新在于:完全从零开始训练,不依赖任何预训练的视觉塔、文本编码器或解码器,采用单一双向 Transformer 同时处理文本和图像,真正实现了多模态原生架构(Multimodal-Native)。
核心功能
NeoMME 提供以下核心能力:
- 单一双向 Transformer 架构 — 文本 token 和图像 patch 共用同一个 Transformer 编码器,而非使用独立的视觉编码器+文本编码器+投影层,从根本上消除模态间的语义鸿沟;
- 16,384 超长上下文 — 每个模型支持 16384 token 的上下文长度,结合对称滑动窗口注意力,高效处理长文档页面和大规模图文检索;
- 原生多语言支持 — 从零训练的 BPE 分词器拥有 131,072 超大词表,支持多语言文本与代码;
- 双检索变体 — 提供 Dense(标准向量)和 Late-Interaction(后交互多向量)两种检索模式,在 Hugging Face Sentence Transformers 生态中开箱即用;
- 极致检索效率 — NeoMME-260M 在 NVIDIA L40S 上每秒可编码 51 页文档,是 ColModernVBERT 的约 2 倍吞吐量;
- 索引体积压缩 255 倍 — 结合非对称量化,单页索引体积从 1.5MB 压缩至 6KB,同时保留超过 95% 的基线检索质量;
- 视觉文档检索 SOTA — 在 ViDoRe v3 视觉文档检索基准上,两个尺寸均位于 Pareto 前沿,超越同尺寸更大参数的竞争对手;
- Apache 2.0 许可 — 完全开源许可,商业部署零门槛。
技术特色
从零开始的多模态训练:NeoMME 不使用任何现成的 CLIP 视觉塔或预训练 LLM 作为起点,而是从零预训练一个离散掩码扩散文本降噪器(Masked-Diffusion Denoiser),在包含多语言文本、代码、数学、文档图像的大规模语料上训练,使模型真正理解图文联合语义。
对称滑动窗口注意力:大多数层使用对称滑动窗口注意力处理长上下文,每第六层和最后一层使用全局注意力,形成局部与全局信息交叉的结构,兼顾效率与全局感知。
Grouped-Query Attention + Query-Key Normalization:采用分组查询注意力机制和 QK 归一化,提升训练稳定性和推理效率。
特色优势
- 多模态原生架构 — 完全不同于「预训练视觉编码器+LLM」拼接方案,NeoMME 从零构建多模态统一语义空间,模态间没有信息损失;
- 商业友好的开源许可 — Apache 2.0,无专利限制,可直接用于商业产品;
- 极高检索效率 — 51 页/秒编码速度 + 255 倍索引压缩,使大规模视觉文档 RAG 系统在成本上真正可行;
- 小参数大性能 — 2.6 亿参数即在 ViDoRe v3 上达到 Pareto 前沿,量化后可在消费级 GPU 运行;
- Hugging Face 生态无缝集成 — 提供 Sentence Transformers 官方接口,pip install 后三行代码即可使用。
应用场景
- 视觉文档 RAG — 对接企业 PDF 档案、合同、发票、手写文档,实现自然语言视觉检索;
- 多语言图文搜索 — 跨语言图文检索,支持文档库的多语言查询;
- 表单/票据自动化处理 — 银行表单、税务发票、医疗单据等结构化视觉文档的信息提取与核对;
- 知识库多模态问答 — 构建同时理解文本和图片的企业知识库问答系统;
- 代码截图检索 — 对开发文档、UI 截图、技术架构图进行语义搜索;
- 学术论文图文检索 — 在大量科研论文中通过文字描述找到相关图表和公式。
适用人群
- RAG 应用开发者 — 构建多模态知识库检索系统的工程师;
- 企业 AI 平台团队 — 需要在私有部署视觉文档检索能力的数据科学团队;
- 多语言 NLP 研究者 — 研究跨语言视觉文档理解的学术群体;
- 金融/法律科技公司 — 处理发票、合同、判决书等大量视觉文档的科技公司;
- 开源社区贡献者 — 希望基于多模态编码器构建更复杂视觉-语言系统的开发者。
出品方
NeoMME 由 H Company 研究团队发布,核心作者包括 Aurélien Lac 和 Tony Wu 等。H Company 专注于多模态 AI 前沿研究,Tony Wu 同时也是 ColPali/ColQwen 等视觉文档检索重要工作的贡献者。
更新动态
- 2026年9月3日:NeoMME 正式开源,发布 260M 和 800M 两款编码器;
- 同日开源 NeoMME-260M-Retriever 和 NeoMME-800M-Retriever 两个检索变体;
- 提供 Hugging Face Transformers 和 Sentence Transformers 双接口支持。
官网链接
https://huggingface.co/Hcompany/NeoMME-260M-Retriever-ST-late
团队信息
AI产品库
官方
由 AI 猎手自动发现
评论与建议
登录 后参与评论或提建议