用Ling-3.0-flash-VL三十分钟做订正作业小工具

AI大土豆 @suanwan
30分钟能干什么?我用蚂蚁百灵刚开源的Ling-3.0-flash-VL,做了个给小孩订正作业的小工具。 以前做这种东西,你得自己接OCR、版面分析、错题识别,甚至训练专用模型。现在一个通用视觉模型,30分钟就能先把整条链路跑通。 我没让它直接处理图片,我让它先看整张作业,把错题、题目区域、手写答案的位置直接输出成坐标。后面的程序拿着这些坐标去裁图、去手写,再整理成可以重新订正的题。这就比单纯OCR有意思多了。 Ling-3.0-flash-VL总参数124B,但MoE每token只激活约5.5B。这对Visual Agent很重要,极为广阔的知识,以及极低的激活,能做到又快又好。 视觉模型不等于出图模型。Ling这种VLM的视觉,是它能看图片、截图、文档、视频。它本身不是Image 2.5那种负责生成像素的模型。它擅长看懂以后,把结果变成文字、坐标、代码或者动作,然后继续干活。 OpenRouter现在可以免费使用Ling-3.0-flash-VL:openrouter.ai/inclusionai/li… 你对Ling-3.0-flash-VL有什么看法?
话题来源 @MinLiBuilds 70.9K阅读 ❤️387 x.com/…↗ 已改写,非原文转载
19 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单