时间:2026年8月11日
地点:德国图宾根 / 美国旧金山
人物:图宾根大学计算机科学家Alexander Panfilov;Max Planck研究所;MATS Research AI安全机构;安全公司Snyk;Anthropic(Claude Opus 4.8);OpenAI(GPT-5.6 Sol);Google;月之暗面(Kimi K3);Z.ai
事件详情:
德国图宾根大学联合Max Planck研究所、MATS Research与安全公司Snyk的研究团队发现,可以通过API访问提取主流大语言模型在"思考"阶段生成的隐藏推理痕迹。研究发现,月之暗面的开源模型Kimi K3在特定提示词下产生的内部推理痕迹,与Anthropic Claude Opus 4.8和OpenAI GPT-5.6的推理痕迹高度相似。相同的漏洞在主流前沿大模型API中普遍存在,可被用来窃取模型内部推理痕迹乃至训练数据中的API密钥、密码等敏感信息,漏洞已在发现后被修复。
背景:
蒸馏(distillation)是把大模型能力转移到小模型的标准做法,2026年以来因被指中国公司系统性复制美国前沿模型而成为争议焦点。Anthropic 6月曾向美国国会报告阿里巴巴系统性地蒸馏Claude模型用于构建Qwen,OpenAI 2月也曾指控DeepSeek基于蒸馏开发了R1。本研究提供了一种全新的可检测技术手段,让推理痕迹模式比对成为确认跨模型蒸馏的新证据形式。耶鲁大学2025年7月发布的相关论文(arXiv:2607.17674)也展示了让语言模型"说出"自己内部思路的类似方法。
影响:
- 主流模型API普遍存在的这一漏洞意味着,任何通过API公开"推理痕迹"的模型都更容易被检测蒸馏来源,从而加剧美中AI模型训练的透明度争议。
- 研究显示大模型的推理痕迹可用于还原密码和API密钥等隐私信息,揭示了"思考过程"本身即新的攻击面,模型提供方必须重新评估是否需要隐藏或混淆推理内容。
- 该方法给AI安全研究带来新工具,但同时也意味着闭源模型公司可以借此手段调查开源模型是否"师出同门",可能改变未来大模型API的设计与披露策略。
- 监管层面,国会和监管机构获得了一种新的取证工具,可能用于AI模型跨境合规与知识产权诉讼。
总结:
图宾根大学领衔的这项研究,把"AI模型内心独白"从理论设想变为可复现的攻击手段。它既是AI安全研究的重要突破,也将让大模型蒸馏溯源变得更具可操作性。在美中AI竞争与跨境监管持续升温的背景下,这类工具可能重塑模型公司之间的知识产权博弈和AI开发透明度规则。
参考来源:
- https://www.wired.com/story/a-new-trick-reveals-ai-models-inner-thoughts/
- https://stolen-thoughts.com/paper.pdf
- https://arxiv.org/abs/2506.15674
- https://news.qq.com/rain/a/20260807A05GRO00
- https://global.chinadaily.com.cn/a/202608/06/WS6a7480afa310986e2b469681.html
- https://www.techradar.com/pro/chinese-military-reportedly-uses-american-ai-models-to-train-its-defense-systems-tools-from-openai-and-anthropic-reportedly-among-those-affected
- https://www.cnbc.com/2026/06/24/anthropic-alibaba-distillation-campaign.html









