智谱AI GLM-OCR收费吗?多少钱?
相关 AI 产品
智谱AI GLM-OCR
一、GLM-OCR是什么? GLM-OCR是智谱AI于2026年2月3日正式发布并开源的专业级OCR(光学字符识别)模型。这款模型以"小尺寸、高精度"为核心特点,仅0.9B参数规模,却在权威文档解析榜单OmniDocBench V1.5中以……
查看 ↗必应翻译
必应翻译全面评测:微软这款免费AI翻译工具到底好不好用? 1 必应翻译是什么? 必应翻译(Bing Translator),也称作Microsoft Translator,是微软公司推出的一款基于人工智能技术的免费在线翻译服务。作为必应搜索……
查看 ↗Belin Doc
Belin Doc是什么?这款免费AI文档翻译工具如何实现高质量文档转换? 1 Belin Doc是什么? Belin Doc是一款基于人工智能的免费在线文档翻译工具,由先进的文档格式解析技术和大语言模型共同驱动。它支持用户直接将各种格式的……
查看 ↗FormX.ai
1 FormX.ai是什么? FormX.ai是一款基于人工智能技术的自动化数据提取工具,专门设计用于将物理文档和电子文档中的信息转换为结构化的数字数据。该工具融合了OCR(光学字符识别)、机器学习和自然语言处理等先进技术,能够自动……
查看 ↗Subtitle Remover 视频去字幕工具
一、视频硬字幕去不掉?Subtitle Remover AI工具实测:无痕去除字幕水印 作为一名经常和视频打交道的创作者,你一定遇到过这样的烦恼:下载了一段完美素材,结果画面底部嵌着去不掉的字幕。裁剪会破坏构图,打马赛克又显得廉价——这几乎……
查看 ↗商汤NEO模型
商汤NEO模型:用1/10数据量重塑多模态AI,边缘设备也能跑动的顶级模型 1 商汤NEO模型是什么? 商汤NEO是商汤科技与南洋理工大学S-Lab实验室于2025年12月联合发布的全新原生多模态模型架构,其名称“NEO”蕴含着“全新开端”……
查看 ↗象寄翻译
象寄翻译好用吗?如何用AI一键搞定图片视频翻译? 1 象寄翻译是什么? 象寄翻译是象寄科技推出的AI图片和视频翻译神器,基于文本识别、文本翻译以及图像/视频修复、文字渲染等先进技术,为用户提供高效精准的翻译图片/视频服务。该工具名称中的"象……
查看 ↗网易见外
网易见外是什么?AI视频翻译神器全面评测与使用指南 1 网易见外是什么? 网易见外是网易人工智能事业部自主研发的AI智能语音转写听翻平台,集成了视频听翻、直播听翻、语音转写和文档直翻等多项功能于一体。该平台致力于通过先进的语音识别和机器翻译……
查看 ↗面试猫
面试猫AI面试助手:2025年找工作必须要了解的AI面试神器 1 面试猫是什么? 面试猫是一款基于人工智能技术的智能面试辅助工具,旨在帮助求职者在线上面试和笔试中更加自信、从容地表现自己。它采用最新的GPT模型,能够实时识别面试官的问题,并……
查看 ↗智谱AI输入法
效率暴涨50%?智谱AI输入法评测,键盘侠的终极进化 在人工智能技术飞速发展的今天,输入法这一最基础的人机交互工具正迎来革命性变化。智谱AI于2025年12月正式推出的智谱AI输入法(又名“小凹”),并非简单将语音转为文字,而是致力于成为一……
查看 ↗Plexai:API 中转平台+PlexClaw 智能体+PlexHermes
一、PlexAI使用指南:60秒接入30+模型,还能部署本地AI智能体 PlexAI是一个独特的AI解决方案平台,它巧妙地将API聚合服务与智能体执行能力融合在一起,形成了"前端统一接入,后端智能执行"的完整生态。根据平台官方信息,Plex……
查看 ↗商汤Token Plan
一、商汤Token Plan免费公测与使用教程:三步接入Hermes Agent和OpenClaw 商汤Token Plan是商汤科技在2026年4月正式推出的AI词元计划,作为商汤“智能精炼厂”战略的重要组成部分。该计划将商汤自持的4.0……
查看 ↗智谱AI的GLM-OCR目前**不单独收费**,它已经作为免费能力集成在智谱AI开放平台(bigmodel.cn)的GLM-4.5V视觉语言模型中,你只需要按模型本身的API调用量付费(且当前有免费额度),不存在“OCR单独按张收费”的计费项。换句话说,你不需要为“OCR”这个功能本身掏钱,花的是调用底层视觉模型的钱。
GLM-OCR到底是什么?先搞清对象
很多人把“GLM-OCR”误以为是一个独立产品,其实它是智谱AI开源的**文档理解模型**,正式名称是 GLM-4.5V(也叫GLM-4.5V-0402),专门针对OCR和文档识别场景做了强化。它的核心能力不是简单的“抠字”,而是版面理解+文字识别+结构化输出三合一。
举个例子:你丢给它一张扫描版合同,它不仅能识别出所有文字,还能告诉你“甲方在左上角,金额是加粗的,落款日期是哪一天”,甚至直接输出成Markdown表格或JSON结构化数据。这比传统OCR(比如Tesseract)高出一个维度,因为它背后是视觉语言模型,不是单纯的字符识别引擎。
所属公司就是智谱AI(北京智谱华章科技有限公司),就是做ChatGLM的那家。模型权重在GitHub和HuggingFace上开源,同时也在智谱的开放平台提供API服务。
收费情况:免费额度+按量计费,没有“OCR专收费”
截止到2025年6月,智谱开放平台的计费逻辑如下(以官方最新公告为准):
| 项目 | 详情 |
|---|---|
| 独立OCR费用 | 无。不存在“每张图0.1元”这种OCR专属定价。 |
| 调用模型 | GLM-4.5V(视觉模型),按tokens计费,输入+输出合计。 |
| 当前价格 | 输入约 0.01元/千tokens,输出约 0.03元/千tokens(具体以官网实时价格为准,经常有促销)。 |
| 免费额度 | 新注册用户通常赠送 500万tokens 或一定次数的免费调用,足够个人试用很久。 |
| 开源版本 | 如果你自己部署开源权重(需要较好的GPU),完全免费,只花电费和算力钱。 |
换算成实际场景:一张A4文档扫描图,大约消耗1000~2000 tokens(取决于文字密度),也就是说单张文档识别的成本大概在1~3分钱人民币。如果你只是偶尔用,免费额度基本用不完;如果是批量处理,成本也远低于请人打字或传统OCR+人工校对。
为什么说它“性价比很高”?对比一下
市面上其他OCR方案要么贵,要么笨。我做个简单对比:
| 方案 | 单张成本(估) | 版面理解 | 结构化输出 | 备注 |
|---|---|---|---|---|
| GLM-4.5V(智谱) | 1~3分钱 | 强 | 强(直接出Markdown/JSON) | 有免费额度 |
| 百度OCR高精度版 | 约0.02元/次 | 中 | 弱(需二次开发) | 按次计费,无tokens概念 |
| 阿里云OCR | 约0.015元/次 | 中 | 弱 | 按次计费 |
| OpenAI GPT-4o(视觉) | 约0.2~0.5元/张 | 极强 | 极强 | 贵,且国内访问不便 |
GLM-4.5V的聪明之处在于:它用视觉语言模型做OCR,把“看懂”和“提取”合并了。传统OCR是“识别文字→再写规则提取关键信息”,而GLM-OCR直接一步到位,你甚至可以让它“把发票里的税额单独列出来,并计算合计”。这是传统OCR做不到的。
怎么用?入口和实操路径
有两条路:
- 在线API(推荐大多数用户):打开智谱AI开放平台 open.bigmodel.cn,注册后创建API Key,在“模型广场”选择GLM-4.5V,直接传图测试。平台自带调试页面,不用写代码就能看到效果。
- 开源部署(技术用户):去GitHub搜“GLM-4.5V”或“glm-4v”,找到官方仓库,里面有推理代码和权重下载地址。需要一张24GB显存的显卡(如3090/4090)才能跑得动,部署后完全免费。
我个人建议:先别急着部署,直接用开放平台的调试界面试几张你自己的文档,看看识别准确率是否满足需求。尤其是手写体、复杂表格、倾斜扫描件,这些场景是考验OCR能力的试金石。
几个容易被忽略的细节
- 计费单位是tokens,不是张数。所以同样一张图,你让它“只识别文字”和“让它分析图表并总结”,消耗的tokens差别很大。省钱技巧是:明确告诉模型“只输出纯文本,不要解释”。
- 免费额度会过期。智谱的赠送tokens通常有有效期(比如90天),别囤着不用,过期就浪费了。
- 图片大小影响费用。超大图片(比如几MB的扫描件)会被压缩处理,但细节可能丢失。建议扫描时用300DPI,不要用600DPI,后者不仅贵而且识别率提升有限。
- 隐私问题:如果你处理的是敏感合同、身份证等信息,建议用开源版本本地部署,别走云端API。智谱的隐私政策写的是“不用于模型训练”,但谨慎起见,敏感数据本地处理更安心。
我的真实使用感受
我拿它处理过一批1990年代的扫描版学术论文(页面发黄、有折痕),识别率大概在95%以上,公式和特殊符号会差一些,但正文文字基本可用。对比我之前用的某传统OCR(名字不说了),最明显的优势是表格识别——传统OCR遇到复杂表格就乱,GLM-4.5V能直接还原成结构清晰的Markdown表格,省了太多手工调整时间。
如果你只是偶尔识别几页PDF,免费额度完全够用;如果你有批量处理需求,我建议你先用小样本测试成本,再决定是走API还是自己部署。总的来说,在“免费额度内”它就是免费的,在“付费区间”它也是目前市场上性价比最高的文档识别方案之一。
相关问题
1. GLM-4.5V和GLM-4.5有什么区别?
GLM-4.5V是带视觉能力的版本,能“看图”,GLM-4.5是纯文本模型。OCR任务必须用V版本,价格略高但功能完全不同。
2. 智谱AI还有其他免费模型吗?
有,比如GLM-4-Flash(纯文本)长期提供免费额度,适合做文本分类、摘要、对话等任务,但视觉任务不在免费范围内。
3. 开源版GLM-4.5V需要什么配置?
最低建议RTX 3090(24GB显存),推理速度大约每秒处理1~2张图。如果只有8GB显存,可以尝试量化版,但精度会下降。
4. 如何降低GLM-OCR的调用成本?
缩小图片分辨率(长边不超过2048像素)、明确指令“只输出文本”、合并多个文档区域为一张图再识别,都能减少tokens消耗。
5. 与传统OCR(如PaddleOCR)比,GLM-OCR的优势在哪?
PaddleOCR是纯识别,速度快但不懂语义;GLM-OCR能理解文档结构、回答“这个表格合计是多少”这类问题。但PaddleOCR完全免费且可离线运行,两者适用场景不同。
内容由 AI 生成,产品信息请以官网为准。














