时间:2026 年 10 月 6 日
地点:GitHub 全球开源
人物:开发者 Niko1221、阿里 Qwen 团队
事件详情:开发者 Niko1221 在 GitHub 开源发布 Strata 引擎 v0.1.38,让普通游戏电脑的 12GB 显存显卡即可本地运行阿里 125B 参数 MoE 模型 Qwen3.8-Flash-Next,单张 RTX 5070 在 Q2_0 量化下达到 94 词元 / 秒的写答案速度、IQ3_S 量化 53 词元 / 秒,AMD RX 9070 XT 同量化下也能跑出 60 词元 / 秒。Strata 引擎同时提供 OpenAI / Anthropic 兼容的本地 API,并已收获约 8400 个 GitHub Star。
背景:Qwen3.8-Flash-Next 是阿里巴巴 Qwen 团队于 2026 年 8 月推出的多模态混合专家压缩版本,配有 125B 主参数加 51B n-gram 嵌入表,原生支持 262K token 上下文,原本需数据中心级 GPU 才能运行。Strata 为降低显存占用,采用两项关键技术:其一将 MoE 模型整体载入 RAM,仅把高频使用的专家模型动态载入 VRAM;其二用轻量模型做投机解码预测下一 Token 加速推理。
影响:这一开源项目把千亿参数大模型的本地部署拉低到 RTX 5070 / RX 9070 XT 级别的消费显卡,硬件门槛从专业级 GPU 降至主流游戏 PC,配合一键安装可让开发者、研究者和发烧友在本地运行 Qwen3.8-Flash-Next 做代码、阅读长文档或驱动 Coding Agent,所有数据不出本机,重新定义了大模型平民化的硬件基线。
总结:Strata 的出现意味着 MoE 架构 + 投机解码 + 专家分载技术组合可以把消费级 GPU 拉成千亿模型推理入口,是继 Ollama、llama.cpp 之后大模型本地化的又一次硬件解放。
参考来源:
- IT之家:12GB 显存显卡跑 125B Qwen3.8 模型:Strata 登场,单张 RTX 5070 跑出 94 词元 / 秒 https://www.ithome.com/1/010/006.htm
- GitHub 项目主页:Niko1221/Strata https://github.com/Niko1221/Strata
- Gigazine 日文版:125B の「Qwen3.8-Flash-Next」の量子化版をゲーミング PC で高速ローカル実行可能にする AI 実行アプリ「Strata」 https://gigazine.net/news/20261005-strata-local-ai/
- 搜狐:12GB 显存显卡跑 125B 模型:Strata 登场 https://m.sohu.com/a/1084498134_122014422
- 知乎专栏:Strata 让普通游戏电脑跑 1250 亿参数大模型 https://zhuanlan.zhihu.com/p/2089282096925878242
- Reddit Qwen_AI 社区实测:I am really geeking out - Strata + Qwen 125bn https://www.reddit.com/r/Qwen_AI/comments/1wy1lw5/i_am_really_geeking_out_strata_qwen_125bn/
- Medium 技术解读:Run Qwen3.8-Flash-Next 120 tokens/s Just One Gaming RTX GPU https://xhinker.medium.com/strate-run-qwen3-8-flash-next-120-tokens-s-just-one-gaming-rtx-gpu-9b94efa10182
- Hugging Face 模型页:alesha-pro/Qwen3.8-Flash-Next-abliterated-GSQ-RCO-Strata-GGUF https://huggingface.co/alesha-pro/Qwen3.8-Flash-Next-abliterated-GSQ-RCO-Strata-GGUF
- Bilibili 教程演示:强推神项目 Strata!12G 显卡跑 Qwen3.8 Flash Next!速度 93t/s! https://www.bilibili.com/video/BV18ha16hE94/







