NeoMME 多模态原生编码器 今日发布

## 产品简介 NeoMME 是 H Company 于 2026 年 9 月 3 日开源的多模态原生多语言编码器家族

LLM大模型 部分免费

产品简介

NeoMME 是 H Company 于 2026 年 9 月 3 日开源的多模态原生多语言编码器家族,包含 NeoMME-260M 和 NeoMME-800M 两款模型,参数分别为 2.6 亿和 8 亿。NeoMME 的核心创新在于:完全从零开始训练,不依赖任何预训练的视觉塔、文本编码器或解码器,采用单一双向 Transformer 同时处理文本和图像,真正实现了多模态原生架构(Multimodal-Native)。

核心功能

NeoMME 提供以下核心能力:

  1. 单一双向 Transformer 架构 — 文本 token 和图像 patch 共用同一个 Transformer 编码器,而非使用独立的视觉编码器+文本编码器+投影层,从根本上消除模态间的语义鸿沟;
  2. 16,384 超长上下文 — 每个模型支持 16384 token 的上下文长度,结合对称滑动窗口注意力,高效处理长文档页面和大规模图文检索;
  3. 原生多语言支持 — 从零训练的 BPE 分词器拥有 131,072 超大词表,支持多语言文本与代码;
  4. 双检索变体 — 提供 Dense(标准向量)和 Late-Interaction(后交互多向量)两种检索模式,在 Hugging Face Sentence Transformers 生态中开箱即用;
  5. 极致检索效率 — NeoMME-260M 在 NVIDIA L40S 上每秒可编码 51 页文档,是 ColModernVBERT 的约 2 倍吞吐量;
  6. 索引体积压缩 255 倍 — 结合非对称量化,单页索引体积从 1.5MB 压缩至 6KB,同时保留超过 95% 的基线检索质量;
  7. 视觉文档检索 SOTA — 在 ViDoRe v3 视觉文档检索基准上,两个尺寸均位于 Pareto 前沿,超越同尺寸更大参数的竞争对手;
  8. Apache 2.0 许可 — 完全开源许可,商业部署零门槛。

技术特色

从零开始的多模态训练:NeoMME 不使用任何现成的 CLIP 视觉塔或预训练 LLM 作为起点,而是从零预训练一个离散掩码扩散文本降噪器(Masked-Diffusion Denoiser),在包含多语言文本、代码、数学、文档图像的大规模语料上训练,使模型真正理解图文联合语义。

对称滑动窗口注意力:大多数层使用对称滑动窗口注意力处理长上下文,每第六层和最后一层使用全局注意力,形成局部与全局信息交叉的结构,兼顾效率与全局感知。

Grouped-Query Attention + Query-Key Normalization:采用分组查询注意力机制和 QK 归一化,提升训练稳定性和推理效率。

特色优势

  1. 多模态原生架构 — 完全不同于「预训练视觉编码器+LLM」拼接方案,NeoMME 从零构建多模态统一语义空间,模态间没有信息损失;
  2. 商业友好的开源许可 — Apache 2.0,无专利限制,可直接用于商业产品;
  3. 极高检索效率 — 51 页/秒编码速度 + 255 倍索引压缩,使大规模视觉文档 RAG 系统在成本上真正可行;
  4. 小参数大性能 — 2.6 亿参数即在 ViDoRe v3 上达到 Pareto 前沿,量化后可在消费级 GPU 运行;
  5. Hugging Face 生态无缝集成 — 提供 Sentence Transformers 官方接口,pip install 后三行代码即可使用。

应用场景

  1. 视觉文档 RAG — 对接企业 PDF 档案、合同、发票、手写文档,实现自然语言视觉检索;
  2. 多语言图文搜索 — 跨语言图文检索,支持文档库的多语言查询;
  3. 表单/票据自动化处理 — 银行表单、税务发票、医疗单据等结构化视觉文档的信息提取与核对;
  4. 知识库多模态问答 — 构建同时理解文本和图片的企业知识库问答系统;
  5. 代码截图检索 — 对开发文档、UI 截图、技术架构图进行语义搜索;
  6. 学术论文图文检索 — 在大量科研论文中通过文字描述找到相关图表和公式。

适用人群

  • RAG 应用开发者 — 构建多模态知识库检索系统的工程师;
  • 企业 AI 平台团队 — 需要在私有部署视觉文档检索能力的数据科学团队;
  • 多语言 NLP 研究者 — 研究跨语言视觉文档理解的学术群体;
  • 金融/法律科技公司 — 处理发票、合同、判决书等大量视觉文档的科技公司;
  • 开源社区贡献者 — 希望基于多模态编码器构建更复杂视觉-语言系统的开发者。

出品方

NeoMME 由 H Company 研究团队发布,核心作者包括 Aurélien Lac 和 Tony Wu 等。H Company 专注于多模态 AI 前沿研究,Tony Wu 同时也是 ColPali/ColQwen 等视觉文档检索重要工作的贡献者。

更新动态

  • 2026年9月3日:NeoMME 正式开源,发布 260M 和 800M 两款编码器;
  • 同日开源 NeoMME-260M-Retriever 和 NeoMME-800M-Retriever 两个检索变体;
  • 提供 Hugging Face Transformers 和 Sentence Transformers 双接口支持。

官网链接

https://huggingface.co/Hcompany/NeoMME-260M-Retriever-ST-late

团队信息

由 AI 猎手自动发现

评论与建议

0 条评论