今晚国产 AI 栈这一周已经讲了五层——模型层(GLM 5.3 Flash)、推理层(Qwen-Image-Layered、ncnn)、硬件层(DeepSeek+昇腾)、学术层(Dario 当年出自百度)、多模态层(清华 VoxCPM2)。
今晚还差一层:国产 AI 模型发布后,本土团队做快速优化这一件事。今晚 四百多赞的一条 Lonely__MH 推给这一层加了今晚最大的一格——Viggle 团队在 Qwen-Image 2.1 发布几天之内,出了一个 5 倍加速的版本(Qwen-Image-2.1-viggle-turbo)。
今晚这一条把今晚国产 AI 栈从五层推到六层——国产 AI 栈不只是模型/推理/硬件/学术/多模态,还有社区优化这一层。
具体说几句关键数字。Viggle 这版做了三件具体的事:40 步压缩到 6 步、端到端提速 5 倍、不需要额外的 CFG(提示词引导)计算。CFG 这一项省下来之后显存压力也跟着降——这件事在消费级显卡上特别重要,因为显存本来就不富裕。
Diffusers 用 r256 版本、ComfyUI 用 r128 版本、文本编码器和 VAE 直接加载原厂——这件事让 Viggle 加速版的接入门槛非常低,原版用户基本不用改代码就能切换。
最后一项是 unmerged 节点加载解决了 stock bf16 精度截断 30% 损耗问题——这件事让今晚加速版的实际效果非常接近原版。今晚这些数字合在一起意味着:今晚 Qwen-Image 2.1 在消费级显卡上能跑得动了。
把这条放到今晚国产线收口的位置上,意义会更清楚。今晚国产线讲了太多层,但今晚之前还差最后一层——国产模型出来之后,本土团队能多快做出优化让普通开发者用得上。今晚 Viggle 这条加进去之后,今晚国产 AI 栈六层全部拼齐:模型层(GLM、Qwen、Kimi)、推理层(Qwen-Image-Layered、ncnn)、硬件层(DeepSeek+昇腾)、学术层(百度 Dario、清华 VoxCPM2)、多模态层(VoxCPM2、Qwen-Image)、社区优化层(Viggle 加速、Qwen-Image-Layered 各种衍生版本)。
今晚这六层加在一起意味着:今晚国产 AI 栈不是一两家公司的产品,是一整个生态在持续运转。
把这条放到今晚算力主权线收口的位置上,意义还会再清楚一些。今晚算力主权这条线讲了太多条——Kling 4.0 视频模型层降成本、Qwen-Image-Layered 图像分层零成本、ncnn+Qwen 2GB 显存跑通、DeepSeek 开源昇腾全栈适配、清华 VoxCPM2、nihui 4G+2G 显存跑 Qwen-Image-2.1。
今晚 Viggle 这条加进去之后,今晚算力主权这条线最末一格——国产模型在国产硬件上能跑、而且快到消费级。今晚这一格补齐之后,今晚算力主权这一周的故事是:今晚国产 AI 栈不再受英伟达锁定,本土生态从模型到硬件到优化全部能自己跑通。
留一格清楚的边界:Viggle 这一版还在早期——原帖自己说"密集小字建议切到 8 步,复杂的多主体多图编辑也稍微逊色于原版"。讨论这件事时把"5 倍加速"和"效果打折扣"分开读,更稳。今晚这一条值得记下来的价值,是今晚国产 AI 社区优化的速度——模型发布几天就有本土团队做出 5 倍加速,这件事本身就是国产 AI 生态的具体体现。
给今天就在 AI 时代做本地部署的人一句落地的:今天做一件事——你下周打算跑的 Qwen-Image 2.1 本地部署,能不能换成 Viggle 加速版。如果原版你已经跑得顺,今晚这一步升级是:换 r128 ComfyUI 节点、把步数从 40 调到 6、显存压力降一半。
今晚这件事今晚就可以做——仓库已经开源,文档已经写好,今晚动手十分钟内能跑通。做完这件事,今晚你手上的 Qwen-Image 2.1 就跑得比今晚之前快五倍,本地体验直接上了一个台阶。













