LLM做规划超过25步就开始犯错——SokoBench把这件事彻底扒开了
LLM 做规划这件事,最近被一个叫 SokoBench 的评测扒了个底朝天——结论不太好看:超过 25 步,规划能力就开始断崖式下跌。
这篇论文来自意大利的 Ipazia、Trento 大学和 Bruno Kessler 基金会,测试方法很聪明:用推箱子谜题(Sokoban)构建了一个纯净的规划环境,刻意把空间复杂度压到最低,只保留一个可移动方块在直线走廊里——这样就能单独测「长视野规划」这一件事,不被其他因素干扰。
结果很有意思。
25 步是分水岭
用 PDDL 规划语言验证过的标准谜题,研究团队让当前主流的大语言推理模型(LRM)去解,记录成功率随步数增长的变化曲线。
25 步以内,模型还能保持相对稳定的输出质量。超过 25 步,性能开始系统性衰减——不是线性下滑,是加速恶化。到 50 步、100 步的级别,最强的模型也只比随机好一点点。
关键不是「做得慢」,是「做不对」。模型会在几步之后就进入循环,反复尝试同一个错误路径,而不是重新规划。论文里叫「replanning failure」——失败了不会换思路,会在原地打转。
为什么不是 scaling 能解决的问题
这让很多人期待的方向落空了。一种常见假设是:只要模型足够强、推理链足够长,规划问题自然会被解决。但 SokoBench 的数据显示,当步数增加时,给模型加推理 token、加思考时间、加外部工具(比如直接调用 PDDL solver),都只有边际改善。
论文的结论比较直白:这是一个架构层面的局限,test-time scaling 可能无法根本解决。
原因在于:模型在生成完整解决方案时,没有外部记忆来追踪每一步之后的状态变化。在真实的推箱子游戏里,方块被推动一次,棋盘状态就永久改变——模型必须在内心里维持一个不断更新的「世界模型」,这个能力在现有架构下是瓶颈。
规划能力和推理能力是两件事
这篇论文和同期其他评测(LLM-WikiRace、HeroBench、ItinBench)一起,指向一个共同发现:模型在单步推理和长链规划上需要的能力集合差异很大。
短期推理依赖的是模式匹配和知识召回,这些在预训练阶段已经被很好地覆盖。长视野规划要求的是主动的状态维护、错误恢复和多路径搜索——这些更接近传统 AI 里的「自动规划」问题,和 LLM 的 next-token prediction 范式有本质差异。
LLM-WikiRace 的数据也印证了这一点:Gemini-3 在简单任务上能达到人类水平以上的表现,但到了困难级别,最好的模型也只有 23% 成功率。瓶颈不在知识量,在规划本身。
这意味着什么
对 AI 应用开发者来说,这个结论有个很实际的含义:如果你要做的任务需要超过 20 步以上的连续决策,不要假设模型能自主完成。比较好的工程实践是把长任务拆成多个短任务,用外部状态管理替代模型的内部状态维护。
这恰好也是现在很多 AI Agent 框架在做的事——用工具调用和外部记忆来弥补模型自身的规划短板。只是以前大家以为这只是过渡方案,现在看起来可能是个长期架构约束。
评论区
登录后可评论。