上周有个做教育产品的朋友跟我吐槽,说他们团队想做一个作业订正工具,结果光是OCR…

我不是小布丁 @xiaobuding
上周有个做教育产品的朋友跟我吐槽,说他们团队想做一个作业订正工具,结果光是OCR、版面分析、错题识别这几个模块就折腾了两个月,最后效果还不理想。 我让他试试蚂蚁百灵刚开源的Ling-3.0-flash-VL。他用了之后直接在群里发了个表情包:这玩意儿是开了挂吧? 具体做法是把孩子做完的作业丢给Ling-3.0-flash-VL,让它先看整张作业,把错题、题目区域、手写答案的位置直接输出成坐标。后面的程序拿着这些坐标去裁图、去手写,再整理成可以重新订正的题。 这就比单纯OCR有意思多了。以前这种东西,你得自己接OCR、版面分析、错题识别,甚至训练专用模型。现在一个通用视觉模型,30分钟就能先把整条链路跑通。 我上周试着用它做了一段技术文档的翻译。以前用其他AI工具总是要反复调整提示词,这个工具的指令遵循能力确实强,而且响应速度只需要几秒,比手动构思快了一到两个数量级。 从技术角度看,这个工具采用模块化架构,每个创作环节都有独立的处理单元。这种方法在开源社区一直存在争议,支持者认为这是效率提升,反对者担心会影响创作质量。 几个关键数字值得关注:Ling-3.0-flash-VL总参数124B,但MoE每token只激活约5.5B。这对Visual Agent很重要,极为广阔的知识,以及极低的激活,能做到又快又好。 这个工具的定位不替代传统OCR或版面分析工具,主要是为了补上它们不擅长的那一环:当你需要在作业订正中嵌入AI判断节点,要求低Token消耗、结构化输出、不能出格的时候,用大模型做这件事成本高、速度慢、还可能生成不可预期的内容。 支持兼容OpenAI和Anthropic的模型与全文件扫描,适合受够误报和评论漂移的团队。 做AI应用开发、需要在视频制作中嵌入AI辅助功能的可以关注一下。 OpenRouter现在可以免费使用Ling-3.0-flash-VL:openrouter.ai/inclusionai/li…
话题来源 @MinLiBuilds 29K阅读 ❤️234 x.com/…↗ 已改写,非原文转载
20 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单