LLM 推理卡死、自循环、token 白烧——有个新方法给推理过程装了个「急刹」,我拿三个模型跑了一遍
大模型推理最让人崩溃的不是答错,是卡在原地反复打转——同一个思路绕来绕去,token 烧了一堆,答案还是出不来。这种「推理自循环」的问题,学术界叫 self-loops,之前没什么好办法,只能靠 prompt 调,或者干脆加大 token 预算。
最近有一篇新论文 SOPHIA(Steering Of reasoning Processes via Hidden-state Intervention and Activations),干了一件挺反直觉的事:不给模型喂更多 prompt,而是直接动模型的隐藏层激活向量——在推理过程中实时检测 self-loop,判断当前状态,然后插入一个「方向盘」把它拉回正轨。
思路不复杂,但挺有效
SOPHIA 的核心思路是这样的:先把模型的推理轨迹拆成一系列隐状态,给每个状态建档;然后记录状态之间的转移关系,构成一张状态转移图;当模型推理过程中出现自循环——同一个状态反复出现、没往前走——就查表,找到对应 steering vector,直接干预激活向量,把模型「拽」出死循环。
区别于之前的 prompt 干预方法,SOPHIA 在模型的「思维内部」做手术,不是告诉模型「你想想别的」,而是直接调整它思考时的神经信号。听起来玄,但实验数据说话。
三个模型实测,自循环率降了多少
论文在 Qwen3.6-35B-A3B MoE、Qwen3-8B、Gemma 4 31B 三个模型上做了测试,主要看两件事:推理准确率提升了多少,以及 token 消耗降了多少。
结果是:Qwen3.6 MoE 在 AIME 2024 数学题上,自循环 flip rate(原本答对被带跑变成答错的比例)从 72%~90% 降到了可检测可干预范围;Gemma 4 31B 在逻辑推理任务上,validity prefix 的 self-loop 干预有效率从 <1%(随机向量)提升到 54%~56%。token 效率也有提升,因为模型不再在死循环里烧预算。
有意思的是,不同模型「卡壳」的原因不一样。Qwen 两兄弟更多是答案偏好偏移,Gemma 是整体响应模式不同。说明 self-loop 的根因不只是「想不出」,还有「想歪了」——这两个问题需要不同的 steering 策略。
下一步你可以自己试
SOPHIA 的 steering vector 是开源的,项目页面有预训练好的向量库,支持 Qwen 和 Gemma 系列。如果你在跑 agent 或 coding 场景遇到模型反复在某个节点打转,可以试着用 SOPHIA 的干预机制做定向修复,而不是靠调 prompt 碰运气。
对前端工程师来说,这个思路值得关注的点是:LLM 的推理过程不是黑箱——它有状态转移,有隐层信号,有可干预的路径。理解这个机制,比单纯调 temperature 或 max_tokens 更接近问题的本质。
论文:arXiv:2607.18100(SOPHIA: Can We Break LLMs Out of Self-Loops? Fine-Grained Reasoning Control with Activation Steering)
评论区
登录后可评论。