AI Agent 到底能不能独立搞科研?给 6 天 + 数千美元算力,原文作者亲自打分,结论出人意料
很多人一直在说 AI Agent 以后能自己搞科研、发论文、推动技术进步。但这个判断到底有多少证据支撑?最近一篇 arXiv 论文用了一个很聪明的实验设计,终于给出了一个相对可信的答案——结论比想象中更复杂。
这个实验怎么做的
研究者找了 24 位作者,包括 Sayash Kapoor(Princeton AI 治理专家)、Arvind Narayanan(知名 AI 学者)等。他们把两篇尚未发表的 NeurIPS 2026 论文的核心研究问题交给前沿 AI Agent,让 Agent 在完全自主的情况下,用 6 天时间和数千美元的算力预算去攻克这两个问题。
关键在于”谁来打分”——不是盲审,不是公开排行榜,而是把 Agent 的产出交给论文的原作者,让他们根据自己论文的学术标准来评判:这份产出到底值不值得推进?
结果:工程能做,科研做不了
Agent 完成了所有工程工作——没有人类干预,没有人来帮忙修复 bug 或者调整方向。但最终,两篇论文都被作者明确拒绝了。
研究者总结了五个反复出现的失败模式:
- 对”什么样的研究值得发表”判断力不足 —— Agent 能写看起来像论文的东西,但分不清什么是一个有价值的学术贡献
- 面对研究设计缺陷时缺乏创造性 —— 当现有方法行不通时,Agent 倾向于重复已有思路,而不是去想全新的角度
- 遇到死胡同不会有效回退 —— 会沿着一个走不通的方向越走越深,浪费大量算力和时间
- 资源感知能力差 —— 不会主动判断”我还有多少算力/时间,这个方向值不值得继续”
- 指令漂移 —— 长期任务中,Agent 容易慢慢偏离原始目标,做着做着就跑偏了
用第二个模型和不同的 scaffold 重新跑了一遍,结果完全复制了这些失败。
这对前端工程师意味着什么
你可能觉得这只是一个学术问题,但背后的结论跟日常工作很近。
Agent 确实能帮你写代码、做测试、搭脚手架——这些本质上都是”工程问题”,有明确的目标和验证标准。但一旦遇到”这个架构选型对不对”、”这个技术方向值不值得投入”这种需要判断力的问题,Agent 的表现就远没有那么可靠了。
换句话说:Agent 能帮你执行,但帮你决策还是要靠人。 这个实验给了一个比较严谨的证据,告诉我们不要过度信赖 Agent 去做开放式决策。
下一步你可以做什么
如果你在团队里负责技术选型或者架构决策,有几件事可以实际落地:
- 给 Agent 分配任务时,尽量把目标收窄,别让它在开放式问题上自由发挥太久
- 用 Agent 做代码生成和工程实现是够用的,但关键节点一定要人复核,不要完全放手
- 遇到 Agent 输出看起来很对但总觉得哪里不对的情况——相信你的直觉,这可能是 Agent 遇到了它自己意识不到的”研究设计缺陷”
原文 arXiv:2607.27191,有完整的专家评审、问卷和日志可以下载查看。
评论区
登录后可评论。