有篇新论文把矛头对准了 Transformer 里最经典、也最少被人质疑的结构——QKV。它的核心问题朴素得像一句抱怨:V 里面有多少东西,真的需要每次根据上下文重新算?同一个 token 在不同句子里显然有大量可复用的信息;与其每次重算,不如给每个 token 建一套可学习的 memory,把独立的 value projection 直接干掉,改写成 V = K + Memory[token]——K 管上下文,Memory 管 token 自带的可复用信息。推理时那次矩阵乘法,基本退化成查表加加法。(论文细节以原帖与原文为准)
改动的第一个红利在计算:省掉的乘法直接变成延迟与能耗;第二个红利更妙——因为 Memory 只跟 token ID 和层数有关,读哪块数据提前就知道,可以把参数放在 CPU、GPU 需要前 prefetch。
实验数字摆得克制:MA-Offload 总参数是普通模型的 2.08 倍,但 GPU 上常驻参数反而少 7.38%,推理延迟基本持平;训练侧达到相同 loss 所需 token 分别省下 29.6% 与 13.8%,下游平均成绩还略高于标准注意力。
第三层红利是 MA-Recall——既然历史 V 能用 K 加 token memory 重建,理论上就不必一直存完整 V Cache,只存 K 和 token ID、要用时再重建;按理论推算 KV Cache 能砍近一半(作者明说:仅分析,未做实际推理实验)。
把这三层红利合起来看,方向感就出来了:过去做 Memory 是往 Transformer 外面加东西,这篇是反过来——既然 Memory 记得住,里面那些计算是不是可以删。
这与今晚一直出现的"预期删除获胜"是同一条哲学换了个层级:harness 层删冗余的前缀与工具描述,架构层删冗余的投影与缓存;两层都在回答同一个问题——这一步真的非算不可吗。省的层级也从请求账单下探到了权重与显存账单,这对端侧与推理成本的意义可能比对训练更大。
论文的自我克制也值得表扬:作者主动说明 MA 参数更多,当前收益无法区分是架构本身还是参数量增加带来的——把最锋利的反驳先替你说出来,这种写法在"划时代"满天飞的年代反而稀缺。转发者那句"划时代"可以听听,但请带着论文自己的这句话一起听;可信度来自把不利条件先摆上桌,这与今晚"大数字盯证据链"是同一条纪律。
给要跟进的人一句落地的:盯三个信号——作者后续有没有做参数对齐的对照实验、MA-Recall 有没有从理论走进实际推理、以及社区有没有独立复现省下的 token 数字。三条落地之前,这是个值得关注的方向;三条落地之后,它可能改变下一代模型的默认结构——"哪些东西根本不用算",大概会成为下一个五年的热门问题。











