华为昇腾支持RL训推一致性 性能最高提升60%

时间:2026年8月5日 地点:深圳 人物:华为计算产品线;昇腾团队 事件详情: 华为计算 8 月 5 日宣布,昇腾基于 Ascend C 编程语言提供完整的训推一致算子集。在 Qwen3-30B-A3B 混合专家(MoE)模型上的实测显示,昇腾方案下的对数概率差值(Logdiff)为 0,意味着推理与训练引擎在权重一致条件下对相同输入的对数概率输出完全一致;同时通过昇腾亲和的 FA(Flash Attention)算子优化,在 Eager 模式下获得 20%-60% 的性能收益,为开发者提供高效可靠的强化学习(RL)训练方案。 背景: 训推一致性(Training-Inference Consistency)是强化学习训练中的核心难题——推理引擎与训练引擎即使使用相同权重,对相同输入算出的对数概率也可能存在细微差异,差异用 Logdiff 衡量。Logdiff 归零意味着训练与推理完全对齐,可大幅提升 RL 训练稳定性与收敛速度。昇腾此次基于 6 月 30 日开源上线的亲和架构实现 Logdiff 为 0 的能力,是国产 AI 芯片在 RL 训练基础设施领域的重大突破,与英伟达 H100/H200 在 RL 训练链路的稳定度对标。 影响: - RL 训练效率提升:Logdiff 归零 + 20-60% 性能收益意味着国产芯片上 RL 后训练(PPO/GRPO/DPO 等)效率显著提升,将加速国产基础模型在 RLHF 阶段迭代速度。 - 国产替代加速:昇腾在 MoE 强化学习训练链路达到与英伟达量级的一致性,将推动大模型公司从 H 系列向昇腾迁移,尤其在 RL 后训练阶段。 - 算子集开源:基于 Ascend C 编程语言的训推一致算子集开放,意味着昇腾生态在开发者层面进一步成熟,为高校、初创公司提供 RL 训练替代方案。 - 国产 AI 芯片 + 国产大模型协同:昇腾与通义千问 Qwen3-30B MoE 模型的实测协同,验证了「国产芯片 + 国产大模型」全栈方案的可行性。 总结: 华为昇腾实现 RL 训推一致性 Logdiff 为 0 + 20-60% 性能收益,是国产 AI 芯片在强化学习训练基础设施领域的标志性突破。该方案已在 Qwen3-30B MoE 模型上验证,将加速国产基础模型在 RLHF 后训练阶段的迭代效率,并推动国产大模型训练算力从英伟达向昇腾迁移。 参考来源: - https://so.html5.qq.com/page/real/search_news?docid=70000021_8396a74437852252 - https://so.html5.qq.com/page/real/search_news?docid=70000021_1796a74412c50752 - https://www.ithome.com/0/986/564.htm - https://so.html5.qq.com/page/real/search_news?docid=70000021_5806a2bbc6335452 - https://www.hangyan.co/reports/3239386898958911118