Cohere Parse 5 今日发布

Cohere推出的企业级文档解析模型,23亿参数视觉语言模型,无需前置OCR阶段即可在单次推理中同步提取文本顺序、HTM

AI搜索知识库 部分免费

Parse 5是加拿大企业AI公司Cohere于2026年8月27日正式发布的文档解析模型,模型ID为parse-v5.0,是Cohere Labs团队基于自研的North-Micro-Vision-Instruct架构打造的视觉语言模型。该模型拥有23亿参数,约4.6GB模型体积,8192 token上下文窗口,是目前企业文档处理领域体积最小、性能与成本平衡最优的解析模型之一。

Parse 5的核心技术突破在于彻底取消了传统文档解析流程中必须前置的OCR环节。传统方案通常需要先用OCR引擎将扫描件或图片转成文本,再用NLP模型进行表格抽取和结构识别,整个流程涉及多个独立模型串联,既增加延迟又积累误差。Parse 5作为视觉语言模型,能在单次推理中同时完成文本阅读顺序提取、HTML格式表格还原、表单键值对识别、图像描述生成以及页面元素边界框坐标标注,将过去三段式流水线的全部工作整合为一步调用。

在输入输出格式上,Parse 5接受PDF、PPT、JPEG三种格式的base64编码数据URI作为输入;默认按页返回Markdown字符串,开发者可设置output_format="blocks"参数获得类型化数据块,此时每个表格携带HTML内容、边界框坐标与页面描述,为RAG系统的引用级追溯提供精准支撑。模型还支持自定义词汇表注入,能适应医疗账单、保险单据、政府表格等垂直领域的专业术语识别。

多语言支持方面,Parse 5在阿拉伯语、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、西班牙语等9种语言上达到稳定解析质量,其他语言支持零样本解析但精度可能低于推荐语言。该模型在Cohere Parse API、Microsoft Azure AI Foundry与AWS SageMaker三大平台同步上线,大型企业客户还可通过单租户Model Vault实现私有化部署,满足数据驻留与气隙隔离的合规要求。

定价策略体现了Cohere在企业市场的差异化定位:Parse API按量计费为1.50美元每千页,Model Vault Medium实例月费2500美元、XL实例4300美元,对应的解析量盈亏平衡点分别约为每月167万页和287万页。这意味着月处理量低于10万页的中小企业可直接走按量付费,高负载企业则适合私有部署。

Parse 5定位为RAG知识库与文档处理链路的基础设施层,下游企业可借此实现"解析即归档",将OCR、表格抽取、图像描述三个环节的供应商依赖整合为单一接口。对于构建法律合同审查、财务报表分析、医学文献整理、保险理赔处理等垂直场景应用的企业而言,Parse 5提供了兼具精度与经济性的解析底座。

团队信息

由 AI 猎手自动发现

评论与建议

0 条评论