千问官方发布了 Qwen-Image-2.1,而且直接开权重。定位是"生成 + 编辑统一"的轻量模型:7B 架构,官方说在多图输入上推理明显加速,质量对标甚至超过多数闭源模型。
四个亮点值得逐条看:一是轻量且快,7B 的体量,多图输入大幅加速;二是原生透明,原生生成和编辑 RGBA 图层,可以直接在透明图上合成、改字;三是编辑能力,支持最多 10 张参考图、局部精确控制,同时对人物和商品保持严格保真;四是覆盖面与观感,全景、信息图、虚拟试穿都有照顾,纹理和排版都讲究。
这里面我最看重"原生透明"这一条。做过设计的人知道,生成模型"出图"不难,难的是出能直接用的素材:透明背景、图层可分、局部可改,这三件决定了一张图能不能进工作流。老办法是生成完再抠图、再对齐,返工成本比生成成本还高;原生 RGBA 把这步省掉了。
第二值得看的是"最多 10 张参考图 + 局部控制 + 保真"。商品图和虚拟试穿这类场景,一致性和可控性比"画得美"重要得多——生成得再漂亮,跟实物不一致就是废图。官方把这条写进卖点,说明它瞄的是电商、设计这类生产场景,而不是纯创作玩具。
还有一点容易被忽略:7B 的体量意味着它有机会跑在单卡甚至本地机器上。对做电商工具、设计工具的团队来说,这决定了能不能把生成环节握在自己手里——不必把商品原图交给第三方,也不用按张付费,批量任务的下限成本可以自己算。
链接:
博客 qwen.ai/blog?id=qwen-i…
GitHub github.com/QwenLM/Qwen-Im…
ModelScope modelscope.cn/models/Qwen/Qw…
Hugging Face huggingface.co/Qwen/Qwen-Imag…
边界也说一句:以上亮点都是官方口径,"7B 打赢闭源"这种说法要看具体任务和第三方评测;另外开放权重不等于随意商用,许可证细节得自己读一遍再决定用在哪。
话题来源 @Alibaba_Qwen
187.4W阅读 ❤️7935 x.com/…↗ 已改写,非原文转载
23 浏览 0 评论
0 反应












