科研 AI 的铁律:跑通不算,对上才算

Dario 那句被转述的话值得盯:数学可以纯靠推理,生物必须做实验。9 月 17 日两件事同日落地——Anthropic 公布用不到四周优化了 AlphaFold3、Boltz-2 在内的 30 多个生物学 AI 模型、代码全开源。 另一边,ScienceIDE 把 Athena++、MITgcm、Gkeyll、NEST、Stim 等 7 学科真实科研代码,封成 15 套 AI 能动手训练的环境。 判分只认一条铁律:改完的代码算出的科学结果,必须和基准参考结果逐点吻合——跑通不算,对了才算。 拿 MITgcm 举例:海洋和大气之间氟利昂交换的模块里埋了一个 bug,AI 要自己找到、自己修好——合合格,不看代码写得漂不漂亮,只看最终输出能不能一个点一个点对上。 三层拆:一,可验证性的双轨:业务代码写错有编译器和单测当场拦,科学代码最吓人的 bug 偏不报错——程序照跑、曲线照好看,氟利昂悄悄偏一点,后面整条气候推论跟着偏。 二,拿业务标尺量科研 AI,量出来的多半是假及格;难度也有数:最难 85 道题、8 家厂商 15 个模型,最好的首试正确率 67.1%——每三道还有一道拿不下,考场没刷穿才有练的价值。 三,自举的第三面:团队把 Anthropic 开源的优化方案也封装进训练环境,内环改 Harness、外环拿规则打分训模型,一边是给 AI 练兵的考场,一边是给科研人的副驾工作台。 做过科研的人都懂:调代码、排 bug、适配工具、核对结果,能吃掉一个博士生大半的时间——过去 AI 帮的是读文献写综述,现在它开始下到几万行的模拟代码里干这些最磨人的活。 口径三条:①ART 长文与数字均为转述——以各官方为准、未复核;②"跑通不算对了才算"是帖中提炼——可引为方法、不作行业标准;③67.1% 与 15 套环境是其引用数据——未复现。 给要验的三条:一,把任务写成"逐点对账":哪个输出必须对上哪条基准,先写死;二,给 AI 的改动设一条不看过程的验收线——结果不对,代码再漂亮也不算过;三,找一道自己的 MITgcm:埋一个不报错的错,看它能不能找到并修对。 你交出去的那个结果,是跑通了,还是对上了?
话题来源 @AYi_AInotes 35.4K阅读 ❤️171 x.com/…↗ 已改写,非原文转载
21 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单