时间:
2026年9月9日,蚂蚁集团宣布推出并开源百灵系列首个原生多模态模型 Ling-3.0-flash-VL。
地点:
中国;模型同步上线蚂蚁百灵平台,并开放至 Hugging Face、ModelScope 等模型社区。
人物:
蚂蚁集团百灵开源团队。
事件详情:
Ling-3.0-flash-VL 基于 Ling-3.0-flash 的混合专家(MoE)架构扩展,总参数量约1240亿,单次推理激活约55亿参数,原生支持图像、文本和视频输入。模型引入视觉反馈闭环,将任务推进为“观察—行动—验证—修正”,可在前端代码生成、GUI 自动化和医疗报告解读等场景中根据执行结果持续调整。IT之家等报道其上下文窗口为256K Token;Hugging Face 模型卡则标注最高可扩展至100万 Token。
背景:
传统视觉模型往往停留在“看图—生成”或问答环节,难以验证输出是否真正达到目标。蚂蚁百灵此次把视觉信息接入理解、推理、规划、行动和验证全流程,并采用视觉编码器、VideoRoPE 与42层混合主干处理图像、视频及长程智能体任务。模型已提供 BF16 和 FP8 权重,FP4、INT4 版本计划后续推出。
影响:
这次开源使多模态模型从内容理解进一步延伸到可执行的视觉智能体:它可以读取界面、调用工具、观察渲染结果并修正代码。蚂蚁集团称,Ling-3.0-flash-VL 在 Artificial Analysis Intelligence Index v4.1.1 中得分42分,比纯文本版 Ling-3.0-flash 高4分;在图片转网页测试中,模型代号 linthium 的得分高于 GPT-5.4。上述评测和应用效果主要来自厂商及媒体披露,仍需更多独立测试验证。
总结:
蚂蚁百灵用124B总参数、约5.5B激活参数的稀疏架构,把视觉输入与智能体执行反馈结合起来。Ling-3.0-flash-VL 的核心看点不只是“能看图和视频”,而是能检查结果后继续行动,为视觉编程、GUI 自动化和长程任务提供了新的开源路线。
参考来源:
1. IT之家:https://www.ithome.com/0/999/997.htm
2. DoNews:https://www.donews.com/news/detail/8/6702605.html
3. AIBase:https://www.aibase.com/news/30924
4. 腾讯新闻:https://news.qq.com/rain/a/20260909A090G700
5. Hugging Face 模型卡:https://huggingface.co/inclusionAI/Ling-3.0-flash-VL
6. Hugging Face FP8 权重:https://huggingface.co/inclusionAI/Ling-3.0-flash-VL-fp8
7. ModelScope:https://modelscope.cn/models/inclusionAI/Ling-3.0-flash-VL
8. 蚂蚁百灵开发者平台更新日志:https://developer.ant-ling.com/zh-CN/docs/getting-started/changelog
9. OpenRouter 模型页:https://openrouter.ai/inclusionai/ling-3.0-flash-vl







