Gradio 揭了个 Qwen-Image 2.1 的底:它画得最好的时候,不是直接画——而是先让一个 9B 的"提示词重写器"把你的请求扩写一遍。这台重写器的家底:20GB bf16、1700 词的系统提示、回答之前先思考约 1600 个 token。随后他们补了一句:我们把它缩到了 0.8B,现在笔记本能装。(原贴附了线程图)
三个数字,三件事。
1700 词的系统提示说明:好图不是生成出来的,是先被"翻译"出来的。你输入的"来张高级感海报"到画手手里时,已经被翻译成了构图、光源、材质、字体关系一整套具体指令。这跟人类设计师接需求的流程一模一样——先把模糊的话翻译清楚,再动手。今晚反复讲"别写感觉、写可执行",原来官方管线里替你干这件事的,就是那个重写器。
1600 token 的思考说明:先想后画已经进了生产管线。重写器在动笔之前先把这次要画什么在脑内推演一遍,这正是"把连续思考应用到一切"主张的落地实例——只不过应用的不是对话,是出图前的那零点几秒。
20GB 缩到 0.8B 这半句,是蒸馏线的第三击。视频侧 H3 用 4 次前向省掉 45 次,图像侧 turbo 模型四步出图,今天轮到重写器本体:20GB 的大家伙缩成笔记本能装的 0.8B,效果还能对齐。三个不同环节、同一招——把重活学成轻活。加速这件事到此基本可以定论:凡是效果好的大组件,迟早都会被压成小的。
给想自己搭出图管线的人一句落地的:别急着换更大的图像模型,先在前面加一层重写。把你的一句话要求扩写成构图、光线、材质、构图四要素再交给模型,多数情况画质先涨一截——这一层怎么都能自己写,甚至可以用今天的 0.8B 起步,笔记本上就能跑。
话题来源 @Gradio
33.8K阅读 ❤️506 x.com/…↗ 已改写,非原文转载
25 浏览 0 评论
0 反应












