时间:2026 年 10 月 2 日,MIT Technology Review 刊发 AlphaGo 核心团队成员 Thore Graepel 的署名观点文章。
地点:发布平台为 MIT Technology Review 官网,作者 Thore Graepel 现为英国伦敦大学学院(UCL)机器学习讲席教授。
人物:Thore Graepel,伦敦大学学院机器学习讲席教授,前 Google DeepMind 研究员、AlphaGo 核心团队成员,长期参与围棋和博弈类强化学习系统的研发。
事件详情:Graepel 在题为《Don't be fooled—LLMs don't reason》的文章中指出,今天的大语言模型只是把下一个 token 的预测做得越来越快、越来越准,所谓的"思维链(chain of thought)"只是把同一个 next-token 预测过程重复更多步,并没有引入真正独立、可审计的推理机制。他列出 LLM 不足以被称为"推理"的三个根本缺陷:第一,模型没有显式、持久、可检查的认知状态来记录假设、置信度、证据和悬而未决的问题;第二,知识和推理过程被完全缠在一起,藏在一团神经网络权重里,没有独立、可显式表达的信念集合;第三,研究已经证明聊天机器人给出的"思维链"常常是先得到答案再编出来的,看上去是推理,实际上是事后合理化。
背景:Graepel 以 2016 年 3 月 AlphaGo 与韩国棋手李世石的第二局做对照:当 AlphaGo 的策略网络把第 37 手评为"专家级棋手大概一万步才会走一次的怪招"时,正是独立的蒙特卡洛树搜索机制,让机器在数千条未来分支里挑出了这步违反直觉的解。他借用 Kahneman 的双系统框架指出,AlphaGo 同时具备 System 1(神经网络直觉)和 System 2(搜索推演)两种能力,而今天的 LLM 只把 System 1 越做越大。文章透露,他近期已离开 Google DeepMind,希望走一条新的机器推理路线。
影响:Graepel 提出 AI 需要一种类似 AlphaGo 博弈树的"显式认知状态(epistemic state)":系统要持续维护已知、存疑、已排除的清单,再借助工具、计算或实验来降低不确定性,并只有在独立证据支持时才更新信念。他强调,药物发现、材料科学、气候变化、医疗诊断等高风险领域需要的不是更大模型,而是一条可追溯的"证据—推理—信念更新"链条。文章已在科技圈引发对"推理模型"营销话术的反思,被视为给正在押注 test-time compute 与长链推理的主流路线打了一记预防针。
总结:AlphaGo 团队核心成员公开提醒行业不要被 LLM 的"思维链"蒙蔽,真正的推理需要可审计的信念更新机制,而不仅仅是把 next-token 预测延长;这为下一代 AI 系统的架构选择提供了与单纯堆参数完全不同的发展方向。
参考来源:
1. https://www.technologyreview.com/2026/10/02/1145639/dont-be-fooled-llms-dont-reason/
2. https://agihunt.info/en/p/1a0fbc86bcfe23dcd39ff14402b
3. https://techbeat.co/story/alphago-veteran-thore-graepel-llms-do-not-truly-reason
4. https://www.zetik.com/news/article/story_id-p008-220730
5. https://oo.news/news/aa0b9d3b6638
6. https://www.myaitemplate.com/en/news/beyond-the-illusion-why-pattern-recognition-is-not-reasoning-muqwy5n9
7. https://news.linxi.com.au/news/alphagos-move-37-renews-debate-over-how-ai-reasons
8. https://technologytangle.com/2026/10/02/dont-be-fooledllms-dont-reason







