10月4日,一位开发者在 Hacker News 分享:他在单张英伟达 RTX 4090(24GB 显存)上成功运行通义千问 Qwen3.8-Flash-Next(125B 参数),实测速度达 **100 tokens/s**,远超市面上任何消费级 GPU 运行同规模模型的记录。
## 技术背景
**Qwen3.8-Flash-Next** 是阿里巴巴通义千问团队于 2026 年 8 月 26 日发布的开源大语言模型,是 Qwen4 架构的首个开放权重预览版:
- **总参数:** 125B(稀疏 MoE 架构)
- **每 Token 激活参数:** 6B(每次推理只激活约 5% 参数)
- **额外嵌入:** 51B N-gram 嵌入表 + 4B MTP(Multi-Token Prediction)
- **上下文窗口:** 支持 25 万 tokens 超长上下文
- **能力:** 编程、协作等任务优于 Qwen3.7-Plus,能力对标 Claude Opus 4.6
此前,125B 参数级别模型通常需要 A100/H100 等数据中心级 GPU 才能流畅运行。
## 实现方式
开发者使用 **llama.cpp** 配合 INT4 量化(IQ3_XXS)在 RTX 4090 上运行,并通过 `--fit` 参数优化显存分配。多位用户在 Reddit r/LocalLLaMA 独立验证,报告 16GB 显存显卡亦可达到 17–26 tok/s。
## 影响
1. **消费级 AI 民主化:** 100T/s 意味着在消费级硬件上获得接近云端付费 API 的交互体验
2. **开源模型本地化提速:** 与闭源模型相比,开源权重模型在本地运行成本趋近于零
3. **Qwen 生态加速:** Flash-Next 成为本地大模型社区最热话题
## 总结
Qwen3.8-Flash-Next 证明:稀疏 MoE 架构 + 量化技术已让 125B 参数模型进入消费级 GPU 时代。这意味着 AI 应用将从云端向本地设备加速迁移。
## 参考来源
1. Hacker News 讨论帖:https://news.ycombinator.com/item?id=49953495
2. Qwen 官方博客介绍:https://qwen.ai/blog?id=qwen3.8-flash-next
3. Hugging Face 模型页:https://huggingface.co/Qwen/Qwen3.8-Flash-Next
4. GitHub llama.cpp 配置:https://gist.github.com/ryan4yin/48617bbddacc7067f10799770b7cc33f
5. NVIDIA 开发者论坛:https://forums.developer.nvidia.com/t/qwen3-8-flash-next/381228
6. YouTube 运行演示:https://www.youtube.com/watch?v=gR20MGAhll8
7. CSDN 本地部署教程:https://bbs.csdn.net/weixin_29800471/article/details/100271550
8. X 社区验证帖:https://x.com/analogalok/status/2092697021790708148







