Kimi K3 的架构里藏了四个设计心思,Sebastian Raschka 说这才不是简单堆参数

很多人以为 Kimi K3 就是把参数规模堆上去,但 Sebastian Raschka 看完技术报告后说了一句:这不是简单的 scaling,这是 efficiency 设计的教科书。

上周 Kimi 放出了 K3 的技术报告,Raschka 第一时间在自己的 LLM Architecture Gallery 发了深度解读。我读完之后觉得这四个设计决策值得专门写一篇。

1. LatentMoE:把 MoE 再压一层

Kimi K3 用的是 LatentMoE,不是普通的 MoE。思路和多头潜在注意力(MLA)一样——把大线性层做下投影压缩。好处是省显存省算力,但效果不打折。Nemotron 3 Ultra 也在用类似方案,但 K3 是第一个把它用到 2.8T 参数规模 frontier 模型上的。

2. Attention Residuals:跨层的残差连接

DeepSeek V4 靠 mHC(manifold-constrained Hyper-Connections)加宽了残差路径。K3 选了另一条路——让残差跨层传递,用注意力分数来决定哪些路径更重要。训练成本多 4%,推理成本多 2%,但验证损失和下游任务表现稳定提升。Raschka 的评价是:这是一条 not an efficiency tweak 的设计,是真的对模型有意义的改进。

3. NoPE 全程使用:第一个这么做的 frontier 模型

这是最让 Raschka 意外的一点。K3 彻底去掉了所有 RoPE 层,全程用 NoPE(No Positional Embeddings)。之前很多架构只在局部注意力层用 NoPE,全局层还是用 RoPE。K3 是第一个全程 NoPE 的 frontier 级别模型。

4. 整体方向:往 inference efficiency 走

MoE → LatentMoE、常规注意力 → 多头潜在注意力 + Kimi Delta Attention。K3 整体思路是在不损失性能的前提下,把推理效率做到极致。2.8T 参数的模型,推理成本控制得住,这才是真正有价值的地方。

Raschka 的结论是:K3 是目前为止最大的开源权重模型,架构设计也相当成熟。如果你关心 LLM 架构演进,K3 值得花时间研究。

原文在他的博客:https://sebastianraschka.com/blog/2026/kimi-k3-architecture-notes.html

评论区

0 条评论

登录后可评论。

AI 论文日报 294 阅读