AI做数学题真会「思考」吗?我翻了三方资料,发现这件事比你想象的复杂得多
上个月,GPT-5.6 Sol 用 90 分钟证出了一个 150 年历史的数学猜想——Maxwell 猜想。上 HN 立刻 93 分,评论区炸了。
但紧接着,一篇 Quanta Magazine 的深度调查让我把刚才想发朋友圈的手又缩了回来。
调查结论很直接:AI 的「思考」可能是个假象。
不是它不能做题——它确实能做,而且做得比大多数数学家还好。问题在于那个「思考过程」:它输出的推理链条,很可能只是「看起来像在思考」,而不是真的在推理。
三方证据,拼在一起看很有意思
证据一:Apple 的研究
Apple 机器学习团队 2025 年发了一篇论文叫《Illusion of Thinking》,结论很直接:大语言模型在简单条件下会遭遇「完全精度崩溃」,推理链条并不可靠。
证据二:Maxwell 猜想论文本身
arXiv:2607.27197 这篇论文很有意思。作者是三位数学家,摘要里有一句话:
GPT-5.6 Sol 给了一个「方向」,数学家来验证和书写。论文在 HN 上引发了大量讨论,有人说这是「low-hanging fruit」,有人说数学家的工作变得廉价了,也有人反驳说「所有证明都是同义反复,数学本质就是逻辑游戏」。
证据三:Melanie Mitchell 的判断
Santa Fe Institute 的 AI 研究员 Melanie Mitchell 接受 Quanta Magazine 采访时说了三句话,我认为是目前最清醒的总结:
一,「它确实有用,比普通 LLM 在推理任务上好很多。」
二,「但输出的推理文本不一定忠实于模型内部实际在做什么。」
三,「很多推理文本其实没用,你完全可以删掉。」
第三点有硬证据支撑:NYU 2024 年一篇论文发现,用一串毫无意义的点号替代人类可读的推理链,模型性能居然没有下降。
为什么「看起来像」不等于「真的是」
这背后有一个训练机制的问题。
LRM(大型推理模型)用强化学习训练,目标是「生成能让最终答案正确的文本」。它没有被明确训练去生成「正确的推理过程」——只要答案对,中间说什么都行。
这就解释了为什么 Kambhampati 的团队可以把正确的推理 trace 换成错误的,模型性能居然不变。因为模型根本不是靠那些「思考」来得出答案的,那些文字只是训练出来的「表演」。
所以到底该怎么用?
这不意味着 AI 做数学题是假的。GPT-5.6 Sol 确实帮数学家找到了一个想了 150 年没人想到的方向,这个贡献是真实的。
但你需要调整使用方式:
把 AI 当探索工具,而不是证明机器。让它给你方向,你自己验证。Maxwell 猜想论文的作者就是这么做的。
别依赖它的「思考过程」作为审计依据。它输出的推理不一定是真实的推理路径。
用结果验证,而不是用过程验证。如果答案可验证(如数学证明),那结果对就对了;如果答案不可验证,先用其他方式交叉确认。
AI 在数学上能做事,但它的「思考」和我们以为的不一样。搞清楚这一点,用起来才不会失望。
评论区
登录后可评论。