时间:2026年9月20日
地点:杭州(阿里千问总部)
人物:阿里千问团队
事件详情:阿里千问正式开源图像生成与编辑统一模型 Qwen-Image-2.1,视觉生成部分仅 7B 参数,将文生图与图像编辑整合在同一模型中,原生支持 RGBA 透明图像的生成与抠图,最多支持 10 张参考图同时输入。Qwen-Image-Bench 评测总分 60.28,超过 Nano Banana 2.0(59.82)与 GPT Image 1.5(59.65),登顶开源生图模型第一。
背景:2025年8月阿里千问发布首个 200 亿参数 MMDiT 架构的 Qwen-Image 模型,本次 Qwen-Image-2.1 进一步压缩到 7B 视觉参数,并采用 20 层 Single-Stream DiT + 64 通道 RGBA VAE + Qwen3-VL 文本编码器架构。模型同时开源了基于 Qwen3.5-VL 9B 微调的提示词改写模型 Qwen-Image-2.1-PE-T2I 与 PE-I2I。
影响:Qwen-Image-2.1 发布当天即获得 Diffusers、ComfyUI、vLLM-Omni、SGLang 等主流框架集成,最小推理显存仅需 7GB,显著降低部署门槛。模型权重已同步上线 GitHub、Hugging Face 与 ModelScope,开发者可直接下载体验。但需注意 Qwen-Image-2.1 采用 Qwen Research License,仅允许非商业研究与评估,商用需另行获得授权。
总结:阿里千问以 7B 小模型体量拿下开源生图评测第一,将文生图与图像编辑、原生透明图层、多图参考能力整合进统一管线,配合主流框架当日集成,大幅降低了图像生成与编辑 AI 工具的部署门槛。
参考来源:
- IT之家:https://www.ithome.com/1/004/989.htm
- 腾讯新闻:https://news.qq.com/rain/a/20260920A0CLE900
- 新浪科技(机器之心 Pro):https://tech.sina.cn/2026-09-20/detail-inisnwyr2387502.d.html
- Lookonchain:https://lookonchain.com/feeds/73324
- GitHub:https://github.com/QwenLM/Qwen-Image-2.1
- Hugging Face:https://huggingface.co/Qwen/Qwen-Image-2.1
- ModelScope:https://www.modelscope.cn/models/Qwen/Qwen-Image-2.1
- DiffSynth-Studio 文档:https://diffsynth-studio-doc.readthedocs.io/en/latest/Model_Details/Qwen-Image-2.1.html







