有个做教育产品的朋友最近在用蚂蚁百灵刚开源的Ling-3.0-flash-VL做了一个小工具,专门给小孩订正作业。他说这个工具确实有点东西,30分钟就跑通了整条链路。
具体来说,他把孩子做完的作业丢给Ling-3.0-flash-VL,没有让它直接处理图片,而是先让它看整张作业,把错题、题目区域、手写答案的位置直接输出成坐标。后面的程序拿着这些坐标去裁图、去手写,再整理成可以重新订正的题。
这种方式比单纯OCR有意思多了。以前做这种东西,你得自己接OCR、版面分析、错题识别,甚至训练专用模型。现在一个通用视觉模型,30分钟就能先把整条链路跑通。
Ling-3.0-flash-VL总参数124B,但MoE每token只激活约5.5B。这对Visual Agent很重要,极为广阔的知识,以及极低的激活,能做到又快又好。而且这种模型甚至很适合当教师模型:先让Ling-3.0-flash-VL批量看作业,生成错题框、手写区域、版面结构这些坐标和标注,再用这些数据训练一个更小、更快的专用模型。
OpenRouter现在可以免费使用Ling-3.0-flash-VL:openrouter.ai/inclusionai/li…
话题来源 @MinLiBuilds
68.9K阅读 ❤️378 x.com/…↗ 已改写,非原文转载
18 浏览 0 评论
0 反应













