时间:2026年7月21日
地点:中国杭州
人物:阿里巴巴千问团队
事件详情:2026年7月21日,阿里巴巴正式发布最新图像生成基础模型 Qwen-Image-3.0,这是千问图像生成和编辑模型系列的第三代基础模型。新模型支持最大 4.5k token 超长输入,可一次生成涵盖公式符号、几何图形、逻辑推导步骤等多元素融合的知识图解与复杂 UI 界面,同时原生支持 12 国语言和 20 多款字体的渲染输出。相比前代 Qwen-Image 与 Qwen-Image-Edit,Qwen-Image-3.0 在图文混排、多语言文本渲染及复杂结构化图像生成方面能力显著提升,进一步缩小了 AI 图像生成在专业排版与设计领域的应用差距。
背景:通义千问图像生成路线起源于 2025 年 8 月开源的 Qwen-Image(20B 参数 MMDiT 架构),主打多语言文本渲染与精确图像编辑。本次 3.0 升级回应了过去一年教育、办公、设计类用户对长提示词、多元素融合渲染、复杂界面生成的强需求。同期正值 2026 WAIC 世界人工智能大会在上海召开,国产大模型集中发布。
影响:
- 把 AI 生图的可用上限从"短标题+简单插画"抬升至"长篇文档式生成",对教育题解、PPT 排版、海报设计等场景的工业落地价值大幅提升
- 原生 12 国语言渲染会直接挤压 Midjourney、Adobe Firefly 在国际化客户中的份额,是国产模型对外输出的关键一步
- 阿里云百炼、千问 AI 平台已开放 API 邀测,Qwen Studio 与千问 APP 即将上线免费体验,进一步完善 Qwen 系列的商业化矩阵
- 加剧国内图像生成赛道竞争——字节豆包、智谱、腾讯混元、可灵等厂商将被迫加速对"长输入+多语言+复杂结构"能力的补齐
总结:Qwen-Image-3.0 是阿里在多模态生成领域的又一次"打地基",从单纯的图像生成走向"图像即文档"。当模型可以在 4.5k token 内一次性画出完整知识图谱和带多语言字体的 UI,原生 Midjourney 风格的视觉创意工具将被重塑为生产力工具。对设计师与开发者来说,"提示词即原型稿"的距离又近了一步。
参考来源:
- https://new.qq.com/rain/a/20260721A076DN00
- https://so.html5.qq.com/page/real/search_news?docid=70000021_5186a5f1c2397452
- https://so.html5.qq.com/page/real/search_news?docid=70000021_9246a5f26c499152
- https://qwen.ai/blog?id=qwen-image-3.0
- https://new.qq.com/rain/a/20250805A01MZ700









