写完了三年 Claude Code,今天才发现它的 reasoning trace 早就被人看光了——这件事把隐私安全的账彻底扒开了
你以为自己写的提示词只有 Claude 在看。今天发现不对——推理链的 token 流可以被从加密块里还原出来。
原理是什么。 Claude 和 GPT 的 CoT(Chain of Thought)推理块是加密传输的,但 Simon Willison 的研究证明:通过对输出 token 序列的统计分析,可以以相当高的准确率还原出强模型的推理内容——不需要解密,只需要「看流」。
具体方法:对模型输出的 token 序列做统计分析,识别出推理段(通常有更高的 token 熵、特殊的 token 分布模式),再结合输出文本的结构特征还原推理链。实验在 GPT-4o、Claude Sonnet、Gemini 1.5 上均有效。
这个研究意味着:如果你在提示词里写了内部策略、架构决策、未公开的产品计划——这些东西在推理过程中出现在 token 流里,就有可能被分析出来,哪怕模型本身没有「说出来」。
Claude Code 的风险在哪。 Claude Code 在处理复杂任务时会生成大量内部推理:任务分解、代码审查、安全分析。这些推理内容理论上和上述攻击向量相同——你让 Claude Code 帮你分析一个未公开的 API 安全问题,推理链里包含了对漏洞的完整描述,这个描述在 token 流层面可能可被提取。
更具体地说:如果 Claude Code 的输出经过了一个中间代理(比如日志服务、MCP server、日志聚合平台),那个中间节点有能力对 token 流做分析,而不需要任何 API key。
实际风险评级。 这不是一个已发生的泄露,是一个技术可行性研究。但对安全敏感的场景——内部代码审查、未发布功能评估、安全漏洞分析——这个向量值得认真对待。
实际风险需要满足几个条件:有中间节点能拿到 token 流、有足够长的推理内容可供分析、攻击者有足够的动机和成本。目前公开的 PoC 还在学术层面,没有看到生产环境的实际利用。
防御思路。 从用户侧:敏感任务用 Auto Mode(审批机制)减少 token 暴露;从模型侧:Anthropic 和 OpenAI 都在研究推理块的隐私保护增强;从平台侧:MCP server 和日志服务应该对 token 流做加密存储,而不是明文记录。
本质上,这件事把「用 AI 编程工具处理敏感工作」的风险从「模型会记住什么」扩展到了「模型的推理过程本身是否安全」。
评论区
登录后可评论。