时间:2026年7月24日
地点:杭州(中国)
人物:阿里云ATH-MaaS团队
事件详情:阿里云ATH-MaaS团队正式开源端到端文档解析模型OvisOCR2。该模型仅以0.8B参数规模,在权威文档解析基准OmniDocBench v1.6上以96.58分的综合成绩登顶榜首,成为首个全面超越传统流水线方法的端到端文档解析模型,标志着该领域迎来由"多模型协作"迈向"统一端到端"的范式转折。模型基于Qwen3.5-0.8B后训练得到,采用监督微调(SFT)、强化学习(RL)、在线策略蒸馏(OPD)以及模型融合四阶段训练流程,并构建了真实文档与合成文档互补的数据引擎体系,可一次性输出包含文本、公式、表格和视觉区域的Markdown结构化结果,覆盖企业知识库、RAG检索、智能问答等核心场景。
背景:文档解析是大模型落地的关键基础设施,承担将PDF、扫描件等非结构化文档转化为可编辑结构化文本的重任。过去多年,该领域一直由"版面分析模型+内容识别模型"的流水线串联方法主导,虽方案成熟,但固有的维护成本高、误差逐级累积、部署复杂等瓶颈长期困扰业界。端到端模型虽然被视为终极演进方向,却因复杂版面、长输出、数学公式与多栏表格交织等场景难以兼顾,始终未能全面胜过流水线方案。
影响:
- 端到端文档解析首次击败流水线方案——0.8B紧凑参数跑出96.58高分,证明单模型路径已具备全面取代多模型串联流水线的能力,文档智能赛道正式进入"统一端到端"时代
- 部署门槛大幅下移——项目采用Apache 2.0协议开源并兼容vLLM等主流推理框架,与Qwen3.5生态无缝衔接,开发者无需额外适配即可集成,使高精度文档解析从企业级方案走向普惠可用
- 通义生态再次扩张——作为基于Qwen3.5-0.8B后训练的代表作,OvisOCR2进一步丰富了通义实验室在多模态理解、企业RAG与智能问答场景的能力矩阵,强化阿里在B端AI基础设施的领先优势
总结:OvisOCR2的开源发布不仅是阿里云ATH-MaaS团队一次技术上的突破,更是文档智能产业从系统工程走向高效模型驱动的关键节点。其以0.8B的小体量、端到端的高精度以及完全开源的合作模式,将进一步加速RAG检索、智能问答、财务与法律文档自动化等场景的标准化落地,同时也为未来更大参数规模、更复杂版面理解的端到端文档模型奠定了范式基础。
参考来源:
- https://www.ithome.com/0/981/138.htm
- https://www.donews.com/news/detail/8/6645611.html
- https://finance.sina.com.cn/wm/2026-07-24/doc-iniiwrap1762344.shtml
- https://huggingface.co/ATH-MaaS/OvisOCR2
- https://modelscope.cn/models/ATH-MaaS/OvisOCR2
- https://m.10jqka.com.cn/20260724/c678412654.shtml
- https://arxiv.org/abs/2607.13639









