时间:2026年10月8日
地点:北京(字节跳动Seed团队)、杭州(DeepSeek)
人物:字节跳动Seed团队(论文作者:朱星宇、易普、程子恒、吕昂、刘婧、应乐星、马毅远、董鑫),DeepSeek团队
事件详情:字节跳动Seed团队在最新论文《Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression》(arXiv:2609.36322)中首次系统性披露DeepSeek V4系列模型存在的"相位盲区"结构性问题。研究人员发现,DeepSeek-V4系列(包括V4、V4-Flash、V4-Pro、V4.1)采用的分块KV-Cache压缩方案会为每个token引入"相位"坐标(即token相对于压缩窗口起点的位置)。当关键信息落在压缩窗口的"弱相位"时,模型检索准确率显著下降。在128K上下文"大海捞针"测试中,同一检索任务在不同目标位置上的准确率差距最高可达40个百分点。V4模型的压缩步长为4,长文性能呈现每4个token的周期性抖动;V4.1调整步长为2后,波动周期同步缩短。研究团队还展示了一个震撼性实验:仅修改DeepSeek-V4-Flash-Base代码开头注释的长度,就能让模型推理在FP8正确模式和FP32错误模式之间来回切换,每4个token循环一次。论文第一作者来自字节跳动Seed团队,参与机构还包括普林斯顿大学、斯坦福大学、加州大学伯克利分校。
背景:分块KV-Cache压缩是当前主流大模型处理长上下文的关键技术,可显著降低显存占用和推理成本。然而,这一压缩过程并非"免费午餐"。当模型将连续若干token打包压缩为单个缓存条目时,每个token相对于压缩窗口的相位成为影响检索性能的新变量。DeepSeek-V4采用压缩稀疏注意力(CSA)和重压缩注意力(HCA)方案,宣称支持1M原生上下文,但字节Seed团队的新研究表明,这种压缩机制存在结构性副作用——常规基准测试仅取平均分,会系统性虚高模型的长文表现,无法反映真实的相位稳定性。该现象在V4-Flash、V4-Pro、V4.1等多个变体中均存在,并非基础模型的偶然bug。
影响:1)挑战DeepSeek V4系列的基准测试可信度——业界惯用的平均分数掩盖了周期性弱点,对依赖长上下文检索的企业用户和开发者构成潜在风险;2)波及整个采用分块KV压缩方案的模型评估体系,包括OpenAI、Anthropic、阿里、字节自家豆包等头部厂商的类似实现均需重新审视相位敏感性;3)为长上下文AI评测方法学敲响警钟,未来评测需遍历所有相位进行扫描测试,而非仅依赖平均分;4)从市场角度看,DeepSeek正在冲刺至少800亿元新融资(投后估值逼近5000亿元),这一发现可能为投资者重新审视其模型真实性能提供新的参考依据。
总结:字节跳动Seed团队最新论文首次系统揭示DeepSeek V4系列KV压缩的结构性相位盲区——长文检索准确率在不同位置波动最高达40个百分点,被平均基准分掩盖。这一发现不仅影响DeepSeek估值叙事,也对整个长上下文AI评估体系提出新挑战。
参考来源:
1. arXiv原始论文:https://arxiv.org/abs/2609.36322
2. 第一作者博客(论文官方页):https://ultimatejupiter.github.io/blog/periodic-weak-spots
3. 第一作者发表列表:https://ultimatejupiter.github.io/publications/zhu-periodic-2026
4. Lacuna论文深度解析:https://lacuna.tiptreesystems.com/paper/periodic-weak-spots-phase-sensitivity-from-chunked-kv-cache-compression/art_830528c6626fee4cfaf7902708b8ca7c
5. ChatPaper学术索引:https://chatpaper.com/paper/352620
6. 深求社区(DeepSeek开源生态社区)讨论:https://www.deepseek.club/user/409344
7. 知乎相关讨论话题:https://www.zhihu.com/question/2091513666864682278







