有个做教育产品的朋友,上周用蚂蚁百灵刚开源的Ling-3.0-flash-VL,…

小白爱摸鱼 @chaozuoye
有个做教育产品的朋友,上周用蚂蚁百灵刚开源的Ling-3.0-flash-VL,花了30分钟做了个给小孩订正作业的小工具。我一开始觉得这不就是OCR嘛,后来发现完全不是一回事。 他的思路是这样的:先让视觉模型看整张作业,把错题、题目区域、手写答案的位置直接输出成坐标。然后后面的程序拿着这些坐标去裁图、去手写,再整理成可以重新订正的题。这比单纯OCR有意思多了,因为它理解的是整个版面结构,不只是文字。 Ling-3.0-flash-VL总参数124B,但MoE每token只激活约5.5B。这对Visual Agent很重要,知识面广但推理成本低,能做到又快又好。以前这种项目你得自己接OCR、版面分析、错题识别,甚至训练专用模型,现在一个通用视觉模型30分钟就能把整条链路跑通。 当然坐标可能有偏差,还远没到干死作业App的程度。但往前一步,这种模型甚至很适合当教师模型——先让Ling批量看作业,生成错题框、手写区域、版面结构这些坐标和标注,再用这些数据训练一个更小更快的专用模型。先让大模型直接干活,再让大模型教小模型干活。 OpenRouter现在可以免费使用Ling-3.0-flash-VL:openrouter.ai/inclusionai/li…
话题来源 @MinLiBuilds 66.9K阅读 ❤️361 x.com/…↗ 已改写,非原文转载
21 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单