时间:2026 年 9 月 23 日(北京时间 3 点),对应夏威夷时间 9 月 22 日 9 点。
地点:美国夏威夷 2026 骁龙峰会主会场 / 全球同步发布。
人物:高通、阶跃星辰(StepFun)、无量火(Ember)、江波龙(Longsys)。
事件详情:高通在 2026 骁龙峰会开幕日宣布,联合阶跃星辰、无量火及江波龙,基于第六代骁龙 8 超级至尊版(Snapdragon 8 Elite Gen 6)移动平台,完成阶跃 StepEdge-Omni 30B-MoE 300 亿参数混合专家模型的端侧完整部署,并现场演示相关智能体助手。
模型架构:StepEdge-Omni 30B-MoE 采用混合专家(MoE)架构,总参数 300 亿,但每个 token 生成仅激活约 30 亿参数(约 10% 路由专家),大幅降低计算量与内存带宽需求,是大参数模型能落到手机端的前提。
性能数据:模型预填充吞吐超每秒 330 个 Token、解码吞吐超每秒 28 个 Token,首字毫秒级生成;Hexagon NPU 在 INT4 模型上预填充性能较上一代提升最高 50%,首个 Token 生成时间缩短约 1.5 秒。
内存优化:通过无量火 Ember 推理引擎与江波龙存算协同方案,模型运行内存需求较行业常规方案降低超过 50%,并支持在智能手机上稳定运行。
上下文与硬件:Hexagon NPU 支持最长 32K 上下文窗口,集成 KV-cache 硬件加速器;CPU 使用 Oryon 核心 2+3+3 架构;Adreno GPU 新增 Matrix 核心并支持 AI Frame Fusion;标准版与 Pro 版预计采用台积电 2nm 制程,搭配 LPDDR6 内存。
本地任务:该方案无需调用云端服务,可在本地完成邮件理解与草拟、行程规划、日历同步、航班及酒店推荐、行程分享等办公智能体任务。
背景:本次发布是 9 月 22 日开幕的 2026 骁龙峰会首日最大新闻。Hexagon NPU 是新平台核心升级,新增 Element Accelerator 专门加速 Transformer 运算,并将片上共享内存扩大 50% 以缓解带宽瓶颈。高通 9 月 11 日已提前解密 NPU 架构,本次峰会则完成首个端侧 300 亿 MoE 完整部署案例,超越苹果在 WWDC 上发布的 200 亿参数基础模型。
影响:1. 端侧 AI 进入"300 亿参数时代",手机首次具备本地承载大规模智能体的能力;2. 数据不出设备、本地毫秒级响应,重塑隐私优先的 AI 体验;3. NPU+CPU+GPU 三引擎协同搭配 LPDDR6 内存将成为下一代 AI 手机标配;4. 与云端 API 相比速度提升数倍至数十倍,有望分流云端推理流量;5. 推动手机从"听指令"走向"会办事"的智能体形态,为安卓阵营应对 Apple Intelligence 留出关键硬件筹码。
总结:第六代骁龙 8 超级至尊版通过 Hexagon NPU、推理引擎与存储方案四方协同,把 300 亿参数 MoE 模型真正塞进手机并跑出 330 Token/s 预填充吞吐,标志着端侧 AI 从"能跑"迈入"能办事"的新阶段。高通+阶跃+无量火+江波龙的"芯片+模型+引擎+存储"四方协同模式,也很可能成为后续端侧大模型部署的行业范本。
参考来源:
1. IT之家 - https://www.ithome.com/1/006/008.htm
2. 新浪财经 - https://finance.sina.com.cn/stock/t/2026-09-23/doc-inisuaap8641283.shtml
3. DoNews - https://www.donews.com/news/detail/8/6720649.html
4. 网易新闻 - https://www.163.com/dy/article/L7G2O5SG05561FZV.html
5. CoinDesk - https://coindesk.cc/qualcomm-to-unveil-snapdragon-8-elite-gen-6-smartphone-chips-with-ai-focus-117558.html
6. AI.jp.net - https://www.ai.jp.net/article/qualcomm-unveils-ai-powered-snapdragon-8-elite-gen-6-chips-that-run-30b-paramete-f54176
7. 凤凰网 - https://i.ifeng.com/c/8wPNa015VYO
8. 中关村在线 - https://m.zol.com.cn/article/12459631.html







