清华大学与无问芯穹等团队的一篇重磅论文(按发布转述:已收录 ICLR 2026、代码已开源)——C2C(Cache-to-Cache,缓存到缓存):LLM 之间从此可以不经过人类文字直接交流。
它开篇点破的死穴,做过多智能体工程的人都懂:两个跑在同一台服务器里的模型,为什么要把脑子里的高维思考硬压成一个个词打给对方看?现有流程是——模型 A 想完还要逐字 Decode(慢、吃显存带宽),吐出一大段文字;模型 B 拿到后再分词、再算前缀。一来一回,既丢掉大量微观语义细节,又堆出毁灭级的延迟与 token 账单。
论文给了三招:其一,消灭中间文本、直接做"思维投影"——A 算完一个字都不生成,由一个轻量神经网络 Neural Fuser 把 A 的 KV-Cache 经高维空间旋转与对齐,直接嫁接进 B 的 KV-Cache(相当于跳过声带和耳朵,把记忆切片瞬间印进对方大脑);其二,可学习门控——不同模型层数结构各异,硬灌会"神经错乱",于是让门控动态挑选哪些关键层吸收外部缓存增益最大、哪层保持独立,毫秒级自适应配平;其三,论文口径的基准——推理提速 2.0–2.5 倍(文本解码的等待被整体省掉)、综合问答准确率较单模型最高 +14.2%、比用文字互聊的 agent 团队还高 5%——因为语义直接融合,原本会被文字丢弃的逻辑细特征被完整保留。
作者的哲学收尾同样锋利(转述):在机器对机器的世界里,自然语言不过是一条"充满歧义、极其拥挤的低速单行道"——两个模型不再用文字互相妥协,正绕过人类的喉咙,在显存带宽之间织出一座人类听不见、却快得不可思议的无声网络。
我的看法:它与今晚两条线正面对撞——57493 说"框架堆正在变成 runtime"(执行层合并),C2C 更激进一步:连 agent 之间那层"先翻译成文字"的协议都打算省掉;也就是说,多智能体协作的下一层瓶颈不是提示词工程,而是 KV 的搬运与融合。
它也从反面印证了"两端设闸"那篇的道理:文字是给人看的冗余格式,机器互传该走机器自己的格式。留一个清醒的疑问:"直接嫁接 KV"在跨模型、跨厂商时怎么对齐、怎么建立信任——论文回答的是同构场景,异构与商用的边界还没到下结论的时候。
基准、提速与"代码开源"均为发布转述(未附仓库地址),细节以论文原文为准。












