Ling-3.0-flash-VL
Ling-3.0-flash-VL 产品描述
一、产品简介
Ling-3.0-flash-VL 是蚂蚁集团于2026年9月9日正式发布并开源的百灵系列首个原生多模态大模型。该模型基于 Ling-3.0-flash 的 MoE(混合专家)架构扩展而来,总参数量为1240亿,单次推理仅激活55亿参数,原生支持图像、文本与视频三种模态的联合输入,上下文窗口最高可达256K Token。
与此前业界常见的"文本模型外挂视觉模块"的拼接式多模态路线不同,Ling-3.0-flash-VL 采用原生多模态联合训练方式,让视觉信息直接参与语言模型的推理过程,从而在提升多模态能力的同时对文本智能也产生了正向增益。模型采用 MIT 协议开源,BF16 和 FP8 权重已在 Hugging Face 与 ModelScope 双平台开放下载,FP4 和 INT4 低量化版本也将于近期发布。
二、核心功能
2.1 视觉反馈闭环机制
Ling-3.0-flash-VL 引入的核心创新在于视觉反馈闭环机制。不同于传统多模态模型"一次性看图生成"的单程范式,该机制将任务推进为"观察 → 行动 → 验证 → 修正"的持续闭环循环。具体来说,模型在执行任务过程中会主动渲染当前结果、与目标状态进行视觉比对、发现偏差后自动修正执行策略,从而显著提升执行结果的可靠性。这一机制使模型在需要多轮迭代的复杂任务中表现尤为突出。
2.2 任意分辨率视觉编码器
模型搭载任意分辨率(any-resolution)视觉编码器,能够无需预处理地直接接收任意尺寸的图片和视频输入,避免了传统 ViT 需要将输入统一调整为固定分辨率造成的精度损失。VideoRoPE 技术进一步赋予模型处理视频中空间位置与时间顺序的能力,使其能够理解视频中前后帧的逻辑关系,进行视频问答与事件定位。
2.3 GUI 智能体操作能力
Ling-3.0-flash-VL 可作为 GUI Agent 使用,能够识别网页与软件界面的结构元素(按钮、菜单、表单等),并将这些视觉元素转化为可执行的操作步骤。在 Image-to-WebDev Arena 官方评测中,该模型以 Linthium 代号取得高于 GPT-5.4 的得分,展示了在网页编程与界面自动化方面的强劲实力。
2.4 医疗报告智能解读
在医疗报告解读场景中,Ling-3.0-flash-VL 支持跨文档数据整合与风险标识。模型可以同时处理多份医疗影像报告、检验单据与病历记录,从中提取关键指标、比对历史数据并标注异常风险项,辅助医生快速完成报告审阅。
2.5 前端代码生成与自修正
模型在图片转网页任务中展现出理解布局与组件关系并生成对应代码的能力,且能够通过渲染结果对比进行自我修正——若渲染结果与原图存在偏差,模型会重新生成并迭代,直至输出满意的前端代码。
三、特色优势
3.1 稀疏激活,兼顾性能与效率
Ling-3.0-flash-VL 采用稀疏混合专家架构(MoE),虽然总参数达1240亿,但每次推理仅激活约55亿参数。这一设计使模型在保留大参数容量以获取更强智能的同时,将单次推理的计算成本控制在可接受范围内。根据公开的 SGLang 部署方案,256K 上下文版本在 4-8 张 141GB 级 H100/H800 GPU 上即可运行。
3.2 原生多模态联合训练的正向迁移
通过原生多模态联合训练,视觉信息的引入不仅没有拉低文本智能,反而在 Artificial Analysis Intelligence Index v4.1.1 评估中较纯文本版本(Ling-3.0-flash)提升了4分,体现了模态间协同增效的特点。
3.3 长上下文支持
256K Token 的上下文窗口使模型能够处理长篇文档、长视频分析以及需要保留长时任务历史的 Agent 操作记录,特别适合复杂的多步骤工作流场景。
3.4 开源开放,部署灵活
MIT 协议开源,BF16 和 FP8 双精度权重开放,开发者可在 Hugging Face 和 ModelScope 自由下载。FP4 和 INT4 低量化版本的上线将进一步降低个人开发者和中小团队的部署门槛。
四、适用人群
- AI 应用开发者:需要将多模态能力集成到产品中的工程师,LingStudio 提供免费在线体验,降低了试错成本。
- 前端工程师与 UI 开发者:利用模型的 GUI Agent 能力和图片转代码功能,可快速生成网页原型并进行自动化迭代修正。
- 医疗科技团队:医疗报告解读与跨文档分析能力可直接服务于医疗信息化产品的智能化升级。
- 具身智能与自动驾驶研究团队:模型的视觉反馈闭环机制为需要实时视觉纠错的场景提供了可参照的开源方案。
- 大模型研究机构:MoE 架构下的稀疏激活策略与原生多模态训练方法具有较高的学术研究价值。
五、应用场景
- 网页与软件界面自动化操作:模型识别界面结构后自动执行跨工具操作,适用于 RPA(机器人流程自动化)场景。
- 图片转前端代码:上传设计稿图片,模型理解布局后生成对应 HTML/CSS/JS 代码,并可自修正至渲染一致。
- 长视频内容分析与事件提取:利用256K 上下文和 VideoRoPE,对长视频进行问答、事件定位与内容摘要。
- 医疗报告智能审阅:跨文档整合患者历史检验数据,标注异常指标,生成结构化审阅意见。
- 多模态 Agent 工作流:结合工具调用能力,构建需要视觉感知→推理→行动→验证闭环的复杂 Agent 系统。
六、出品方
蚂蚁集团(Ant Group)基础智能技术部,隶属 inclusionAI 开源组织。蚂蚁集团是中国头部金融科技公司,百灵系列大模型是其核心 AI 基础设施之一,已支撑超过1.5亿用户的国民级 AI 应用(包括支付宝 AI 版"阿宝"与 AI 原生助手"灵光")。
七、更新动态
- 2026年9月9日:正式发布并开源,BF16 和 FP8 权重上线 Hugging Face 与 ModelScope。
- 2026年9月5日:模型率先在海外 X 平台亮相,触发海外开发者社区关注。
- 近期计划:FP4 和 INT4 低量化版本即将发布,进一步优化个人部署体验。
八、官网与资源链接
- Hugging Face 主页面:https://huggingface.co/inclusionAI/Ling-3.0-flash-VL
- Hugging Face FP8 版本:https://huggingface.co/inclusionAI/Ling-3.0-flash-VL-fp8
- ModelScope 主页面:https://www.modelscope.cn/models/inclusionAI/Ling-3.0-flash-VL
- ModelScope FP8 版本:https://www.modelscope.cn/models/inclusionAI/Ling-3.0-flash-VL-fp8
- 在线体验入口(LingStudio):https://lingstudio.antgroup.com(免费体验)
评论与建议
登录 后参与评论或提建议