时间:2026-09-12
地点:韩国大田 / Naver AI Lab
人物:KAIST 研究员 Seogyeong Jeong、Alice Oh、Naver AI Lab 的 Taekyung Kim、Dongyoon Han、Jaehui Hwang、Geonmo Gu
事件:韩国 KAIST 与 Naver AI Lab 联合发布论文《Beneath the Surface of Chains-of-Thought: A Mechanistic Interpretation of Reasoning Operations in LLMs》,揭示大语言模型内部的推理步骤表征规律
事件详情:研究团队定义了八种常见的推理操作,包括问题提取、目标分解、公式回忆、推导、计算等。他们让 Qwen2.5-7B、Qwen3-8B、Gemma4-31B 三款模型解数学题,再用 GPT-5 给解法分段打上推理操作标签。结果发现,不同推理操作在模型的内部表征中可以可靠分离,且分离信号在中间层最强。研究还表明,仅看表面词元比看内部表征的分类器准确率更低,位置信息也无法解释这一现象,这意味着模型内部状态携带了超出表面措辞的推理步骤信息。同一表层词在不同推理步骤下会获得不同的内部表征。即便推理出错,所执行的步骤类型仍然可识别。研究在 Llama-3-8B 上复现成功,Qwen3-8B 训练的分类器还能迁移到 GPQA-Diamond 与 MATH-500 数据集
背景:AI 安全与可解释性研究长期关注"读懂"模型推理过程。OpenAI 与 Anthropic 等公司把读 chain-of-thought 当作少数可用的监督工具,但 Anthropic 此前研究显示模型仅在 25%~39% 情况下如实披露所用线索。OpenAI 的 Astra 模型又把部分推理挪到了内部表征中,本研究正切入这一空间
影响:该方法为大模型可解释性提供新路径,未来或可用于实时捕捉错误推理、引导模型在生成中途转向。若能突破数学任务限制、迁移到更广泛场景,将对 AI 安全与对齐研究有实质性推进
参考来源:
1. The Decoder 原文:https://the-decoder.com/ai-models-written-reasoning-steps-correspond-to-distinct-internal-patterns-a-new-study-finds/
2. arXiv 论文:https://arxiv.org/html/2609.04753v1
3. KAIST 作者主页:https://alice.oh/
4. Naver AI Lab:https://naver-ai-lab.github.io/
5. 项目代码与材料:https://github.com/naver-ai/beneath-cot
6. The Decoder 报道(Kaist reasoning study):https://hellomarvisaitoday.com/articles/b00d86f0-6e52-44eb-b64c-eedaa0ff2c22
7. Hacker News 讨论:https://the-decoder.com/ai-models-written-reasoning-steps-correspond-to-distinct-internal-patterns-a-new-study-finds/









