时间:2026年9月3日
地点:法国巴黎 / 全球开源社区
人物:H Company 研究团队(Aurélien Lac、Tony Wu 等)
事件详情:H Company 于 9 月 3 日发布 NeoMME 多语言多模态编码器家族,包含 260M 与 800M 两个参数版本,全部基于 Apache 2.0 协议开源。NeoMME 采用单一双向 Transformer 同时处理文本 token 与 32×32 图像块,不再依赖独立的预训练视觉塔或因果解码器。研究团队从零训练,使用 13.1 万词表的 BPE 分词器,覆盖多语言文本、代码、数学与文档图像,预训练数据规模达 524B tokens。
背景:当前主流视觉文档检索模型多由生成式视觉语言模型改造而来,需要叠加额外的视觉编码器、投影层与因果解码器,但检索、分类等任务本身并不需要生成能力,参数与算力开销被白白携带。NeoMME 正是瞄准这一冗余,从架构层面直接砍掉冗余结构。
影响:NeoMME-260M 在 NVIDIA L40S GPU 上以 2048×2048 输入可编码约 51 页/秒,速度约为 ColModernVBERT 的两倍;配合分层 token pooling 与非对称量化,迟交互索引存储从 1.5MB/页压缩到 6kB/页,缩小 255 倍,同时保留 95% 以上的 nDCG@10 检索质量。260M 与 800M 两个版本均落在 ViDoRe v3 视觉文档检索基准的 Pareto 前沿。模型已在 Hugging Face Transformers 中开放下载,并附带可视化 RAG Demo。
总结:NeoMME 标志着"为检索而生"的轻量多模态编码器走向成熟,单 Transformer 架构对后续视觉 RAG 研究具有方向意义;Apache 2.0 协议可商用,对企业级文档智能部署是一大利好。
参考来源:
- Hugging Face 官方博客:https://huggingface.co/blog/Hcompany/neomme
- 技术报告(arXiv 2609.01657):https://arxiv.org/abs/2609.01657
- Hugging Face 模型集合:https://hf.co/collections/Hcompany/neomme
- HyperAI 深度报道:https://beta.hyper.ai/en/stories/aad76210e0dcff1a0c1499c000a6fd2e
- TokenFeed 工程分析:https://tokenfeed.ai/one-transformer-to-rule-both-text-and-image
- AIPulseLab 信号分析:https://aipulselab.tech/news/neomme-an-efficient-multimodal-native-and-multilingual-encoder-e9541d
- Artiverse 详细解读:https://www.artiverse.ca/neomme-builds-multimodal-encoders-from-scratch
- KiaDev 行业洞察:https://kiadev.net/news/2026-09-03-h-company-neomme-encoders









