86个任务与25点2的提升

我不是小布丁 @xiaobuding
Google just automated the PhD。这句原话直译过来就是把博士的活全自动化了,框架叫 ScientistTwo。读问题、翻文献、立基线、提假设、写代码、跑实验、做消融,最后还跟一个模拟的同行评审引擎反复吵完再投稿,全程没有人在环里。 它的测试定得很高,对标 NeurIPS 和 ICML 这类顶会的录用标准。结果摆出来是三个数字。在 86 个任务上改进了人类的最好成绩。平均比最强的人类模型高 25.2%。引用零幻觉,代码库全部可执行并经验证,论文是能直接投出去的专家级。 把流程拆开看,每一段都不是新发明。文献检索是现成能力,假设生成早就有,代码执行和实验自动化更是老本行。新东西在串联方式上。它一条不断线地走完全程,最后还敢自己签字投稿。单点能力和系统能力的差距,这篇给了个清楚的样本。 我更在意自我评审那一步。多数自动化研究停在自己写自己改,它多了一道跟评审引擎的对抗,等于把审稿人的刁难提前搬进了循环。这跟前面看过的模拟器试轨迹是同一个套路,把外部压力变成内部步骤。区别只是这次吵的是论文。 "高级实习生的时代结束了"这句判断我认。过去两年 AI 的角色是帮人写代码、整理数据,产出始终要人兜底。这套框架把兜底的人拿掉了。整个行业过去两年攒下的分段能力,被它接成了一条能自证的流水线。 对着顶会标准这一条再想一层。审稿人平时拒稿的常见理由就三条:基线不牢、消融缺失、引用凑数。这三项恰好全被框架写进了固定步骤,立基线是流程的一部分,消融研究是必跑的一环,引用零幻觉则直接堵死了凑数那条路。等于把顶会的差评清单反向翻译成了流水线的验收项,这种设计思路比数字本身更值得学。 还有一个细节藏在"写代码并验证"里。它产出的是可执行的代码库,不是论文里的伪码。这一步把科研和工程接上了,审稿人想复现时不用再找作者要代码,仓库本身就是证据。科研流程里最容易烂尾的复现环节,被顺手修掉了一半。 保留的地方也有。86 个任务集中在机器学习领域,是它自己够得着的战场。模拟评审终究是自洽的回路,真实审稿人的口味它还没见过。25.2% 这个数字漂亮,但它衡量的是既定任务上的性能改进,不是无人区里的新发现。 沿着这套流水线往下想,受影响的首先是研究助理那层的活。跑基线、做消融、整理引用,这些过去压给新人的重复劳动,正是框架跑得最顺的部分。真正没被替代的是提出那个值得问的问题,它能优化问题的答案,还不能替人决定该问什么。这个分工短期内不会翻转。 下一波讨论会围绕三个数转:86 个任务、25.2%、零引用幻觉。哪天这组数里出现未知问题那一栏,性质就变了。眼下它还是在人类划好的跑道里跑得最快的那个,跑道本身暂时还是人画的,距离也没人告诉它还有多远。
话题来源 @HowToPrompt__ 173.1K阅读 ❤️2028 x.com/…↗ 已改写,非原文转载
25 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单