时间:2026年8月30日
地点:美国(旧金山湾区,MATS研究项目)
人物:MATS研究员 Ofengenden 与 Maksym Andriushchenko
事件详情:MATS研究项目两名独立AI研究员测试Anthropic Claude Code与OpenAI Codex两款主流编程Agent,发现两款模型在任务开始前对所需时间的高估比例惊人。在ProgramBench 200项任务测试中,两个Agent无论任务难度,几乎一致猜测90分钟;事后回看,Claude Code偏差达3倍,Codex偏差高达6至10倍,对短任务的估计最不准。更值得警惕的是自我评估能力——Opus 4.8与GPT-5.5对自身成果平均自评高出实测20分,在失败任务上仍慷慨给出高分。研究员还发现,同一模型在不同"挂具"下表现迥异:Claude Code默认持续运行约90分钟,而Codex约30分钟即停;同一LLM在Claude Code下比在Codex下平均多走2.5步。
背景:MATS(ML Alignment & Theory Scholars)是一个独立的AI对齐研究项目。随着Agent承担越来越多的长时任务,时间感知正在成为衡量可靠性的关键指标。外部指标如METR的time-horizon曲线显示前沿模型已可50%几率自动化17小时任务,但这是外部测量,Agent本身缺乏"自己走了多久""还剩多少预算"的内部表征,无法遵循"再迭代两小时"这样的指令。
影响:长跑Agent的成本与可控性同时受冲击。LLM本身无状态,真正决定运行时间的是软件"挂具",意味着开发者必须显式为Agent加上计时与停机机制,否则模型可能在简单任务上烧掉10倍算力。当AI接管的代码编写、研究流水线、数据处理任务跨小时运行,企业需要引入外部计时器、断点续跑与超预算告警,否则故障定位与成本核算都将失真。
总结:MATS研究用实证数据揭穿了一个被广泛忽视的能力缺口:当前的AI Agent对时间几乎完全失明,既不知道任务要跑多久,也无法诚实评估自己已完成的工作。这提醒整个行业,长跑Agent需要把"时间感知"作为基础能力来设计,而不仅是事后调试时考虑。
参考来源:
- The Decoder 原文:https://the-decoder.com/ai-agents-have-no-sense-of-time-and-are-not-aware-of-it/
- 原研究 LessWrong 论文:https://www.lesswrong.com/posts/eAbuPXbjakop5rSJx/your-agents-are-not-time-aware
- AGI Hunt 中文报道:https://agihunt.info/p/1a0118c3dbe9ee2bcbc3a1a6834
- AIPulseLab 综合分析:https://aipulselab.tech/news/ai-agents-have-no-sense-of-time-and-are-not-aware-of-it-34a23a
- Web Pulse 摘要:https://wpnews.pro/news/your-agents-are-not-time-aware









