时间:2026年9月6日(阿里千问本周内正式开源)
地点:中国·杭州(阿里巴巴通义千问团队),模型同步上线 GitHub、Hugging Face、ModelScope 三大平台
人物:阿里巴巴通义千问(Qwen)团队
事件详情:阿里千问开源了 Qwen-Drive-1.0-4B,这是一款基于 Qwen3.5-4B 构建的自动驾驶视觉语言模型。官方称 Qwen-Drive-1.0 是首个面向自动驾驶的视觉语言基础模型,在预训练阶段就统一了 3D 感知与视觉问答,并进一步扩展到运动规划,同时完全保留了预训练 VLM 的原始架构未做改动。技术方案上,原生多模态的 Qwen3.5-4B 作为共享 VLM 主干,外挂两个模块:一个 BEV 感知头,联合完成 3D 目标检测、语义占据栅格预测与 BEV 地图分割;一个规划专家,基于共享 VLM 表征通过 flow matching 生成自车未来轨迹。未改动的 VLM 仍可对驾驶场景进行自由问答。模型采用分阶段训练方案,把驾驶监督数据与通用视觉语言数据结合,在获得驾驶专用能力的同时保留通用视觉理解与指令遵循能力,缓解灾难性遗忘。Qwen-Drive-1.0-4B 同时提供 SFT 与 RL 两个规划专家,官方评测覆盖 3D 感知、驾驶场景理解、通用视觉语言能力,以及开环、伪闭环和闭环运动规划三档。
背景:Qwen-Drive-1.0 的规划样本仅使用公开来源构建,统一了各数据集的轨迹标注格式,并从开环预测一路评估到闭环驾驶。官方数据显示,SFT 模型在所有基准上已具备竞争力;经过强化学习后,模型仅以极小的开环位移误差为代价,换来了人类偏好对齐与闭环安全性方面的全面提升。配套技术报告已发布在 arXiv(编号 2609.00111),代码、演示数据与文档在 GitHub 仓库 QwenLM/Qwen-Drive-1.0 开放。
影响:此前自动驾驶领域的视觉语言模型多为在通用 VLM 之上做改造或裁剪,Qwen-Drive-1.0 选择保持预训练架构完全不变、以外挂模块补齐 3D 感知与轨迹规划,为业界提供了一条"通用基座不动、专用能力外接"的工程路径。4B 的参数规模对车端部署友好,加上完整开源权重与训练配方,中小车企与自动驾驶方案商可直接基于该模型做二次训练,降低自研 VLA/VLM 的门槛。BEV 感知头作为显式、可检视的 3D 探针,也回应了端到端方案长期被质疑的可解释性问题。
总结:阿里千问开源 Qwen-Drive-1.0-4B,主打"首个自动驾驶视觉语言基础模型",在预训练阶段统一 3D 感知与视觉问答并扩展至运动规划,架构保持原生 Qwen3.5-4B 不变,提供 SFT 与 RL 双规划专家,权重与代码已在 GitHub、Hugging Face、ModelScope 全量开放。
参考来源:
1. IT之家 - 阿里千问开源 Qwen-Drive-1.0-4B:首个面向自动驾驶的视觉语言基础模型 https://www.ithome.com/0/998/997.htm
2. GitHub - QwenLM/Qwen-Drive-1.0 官方仓库 https://github.com/QwenLM/Qwen-Drive-1.0
3. Hugging Face - Qwen/Qwen-Drive-1.0-4B 模型页 https://huggingface.co/Qwen/Qwen-Drive-1.0-4B
4. ModelScope - Qwen/Qwen-Drive-1.0-4B 模型页 https://modelscope.cn/models/Qwen/Qwen-Drive-1.0-4B
5. arXiv - Qwen-Drive-1.0 技术报告 https://arxiv.org/abs/2609.00111
6. Hugging Face Papers - Qwen-Drive-1.0 论文页 https://huggingface.co/papers/2609.00111








