30分钟,用蚂蚁百灵刚开源的Ling-3.0-flash-VL,做了个给小孩订正…

成吉思鸡 @xiaoben
30分钟,用蚂蚁百灵刚开源的Ling-3.0-flash-VL,做了个给小孩订正作业的小工具。 现在这种视觉模型,已经开始够快、够便宜,可以直接拿来干活了。 我没让它直接处理图片,我让它先让它看整张作业,把错题、题目区域、手写答案的位置直接输出成坐标。 后面的程序拿着这些坐标去裁图、去手写,再整理成可以重新订正的题。 这就比单纯OCR有意思多了。 当然,现在还远没到干死作业App。它坐标可能有偏差。 但以前这种东西,你得自己接OCR、版面分析、错题识别,甚至训练专用模型。现在一个通用视觉模型,30分钟就能先把整条链路跑通。 Ling-3.0-flash-VL总参数124B,但MoE每token只激活约5.5B。这对Visual Agent很重要,极为广阔的知识,以及极低的激活,能做到又快又好。 再往前一步,这种模型甚至很适合当教师模型。先让Ling-3.0-flash-VL批量看作业,生成错题框、手写区域、版面结构这些坐标和标注,再用这些数据训练一个更小、更快的专用模型。 先让大模型直接干活,再让大模型教小模型干活。 OpenRouter现在可以免费使用Ling-3.0-flash-VL:openrouter.ai/inclusionai/li… 这个工具的出现,意味着AI视觉模型的门槛又降低了一层。以前需要专业技能才能完成的工作,现在普通人也能轻松搞定。 不过,这类工具生成的项目质量如何,还需要实际测试才能知道。建议大家先用小样本测试一下效果,再决定是否大规模使用。
话题来源 @MinLiBuilds 66.7K阅读 ❤️359 x.com/…↗ 已改写,非原文转载
22 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单