阿里Qwen-Image-Layered开源:Alpha通道图层编辑,AI生图终于能只改一处不动全局

封面由站内生成
说个真事,上周我用AI生成了一张产品海报,客户说「把左边的猫往右挪10厘米」,结果AI直接重新生成了一张完全不一样的图。猫变了、背景变了、连色调都变了。这种「牵一发而动全身」的随机性,一直是AI绘图在专业设计领域的致命伤。 但今天阿里开源的Qwen-Image-Layered,可能真的要改变这个局面了。 🚀 这个模型到底牛在哪? 简单说,它让AI生图第一次拥有了「图层」概念。以前的视觉大模型理解图片是扁平的——一堆像素点挤在一起,分不清前景背景、远近遮挡。Qwen-Image-Layered通过自研的RGBA-VAE编码,在传统RGB图像中引入了Alpha通道(透明度图层),让模型天然具备分层思维。 这意味着什么? · 你可以单独移动画面中的某个元素,背景自动补全,不会「穿帮」 · 编辑某个图层时,其他图层完全不受影响,真正实现「零漂移」精准编辑 · 模型能自动「脑补」被遮挡部分的背景纹理,空间理解能力大幅提升 💡 为什么说这是专业级突破? 千问团队从海量PSD文件中提取真实图层逻辑来训练模型,相当于让AI从「出生」起就拥有专业设计师的分层思维。配合VLD-MMDiT架构和图层级3D位置编码,它不再是简单的「像素预测」,而是真正的「结构重组」。 对于设计师、动画和影视制作人员来说,这意味着AI生图不再是死板一块,而是一个活生生的、可无限调整的素材库。商业广告、UI设计、影视后期这些对精度要求极高的场景,终于有了可用的AI工具。 目前模型已在魔搭社区和HuggingFace开源,可免费商用。阿里至今已开源近400个千问模型,全球下载量突破7亿次。 🔗 相关链接 soft.china.com/article/284473…
25 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单