通义千问团队刚开源了Qwen-Image-2.1,这是Qwen-Image系列里最均衡、性价比最高的图像生成模型。7B参数的轻量架构,却能跑赢大多数闭源模型,推理速度还特别快。
这个模型最让我惊喜的是原生透明度支持。它能直接生成和编辑RGBA图层,这意味着你可以无缝合成图像,还能在透明背景上编辑文字。做设计的朋友应该知道,这个功能在其他模型里要么不支持,要么需要额外处理。
项目地址:github.com/QwenLM/Qwen-Im…
模型地址:modelscope.cn/models/Qwen/Qw…
Hugging Face:huggingface.co/Qwen/Qwen-Imag…
我昨天用它生成了一组产品展示图,效果确实不错。支持最多10张参考图输入,能精确控制局部修改,同时保持人像和产品的高保真度。全景图、信息图、虚拟试穿这些场景都能搞定,纹理真实,排版优雅。
具体来说,这个模型适合几类场景。电商产品图生成,需要保持产品外观一致性的同时调整背景或角度。UI设计素材制作,需要透明背景的图标和组件。内容创作配图,需要快速生成高质量的插图。
我有个做电商的朋友,他之前用其他模型生成产品图,每次都要花大量时间后期处理。用了Qwen-Image-2.1之后,生成的图基本可以直接用,省去了很多后期工作。他说最爽的是透明背景功能,终于不用再手动抠图了。
这个模型的开源对整个AI图像生成领域都是个好消息。7B的参数量意味着它可以在消费级GPU上运行,降低了使用门槛。同时,它的性能表现证明了开源模型在图像生成领域也能达到商业级水准。
话题来源 @Alibaba_Qwen
241.4K阅读 ❤️2435 x.com/…↗ 已改写,非原文转载
21 浏览 0 评论
0 反应















