你有没有想过,睡前启动一个脚本,第二天醒来就能收获一百次机器学习实验的结果,其中一部分还确实比你手动调参调得更好?
这就是Andrej Karpathy今年3月开源的autoresearch项目在做的事。整个仓库核心代码只有约630行Python,却实现了一个完整的AI自主研究循环。
它的原理其实很直白:给AI Agent一个真实的LLM训练环境,让它自己修改代码、启动训练、五分钟后检查结果。验证损失降低了就保留改动,没降低就回退,然后继续下一轮。你早上醒来,面前是一串实验日志,和一个可能变好了的模型。
整个系统只有三个核心文件。prepare.py负责数据准备,智能体不能动;train.py是约630行的训练脚本,包含完整的GPT模型定义和训练循环,这是智能体唯一可以编辑的文件;program.md是一个Markdown文件,充当给智能体的指令手册,由人类编写。
这里的设计哲学很精妙:人类编写指导智能体行为的元程序,智能体负责编写和修改实际的训练代码。人机角色的边界被清晰划分——人类做策略决策,AI做执行迭代。
训练时间预算被硬性固定为5分钟。这个设计有两个好处:不同实验之间的结果可以直接比较,不管智能体把模型改大了还是改小了;同时系统会为你的硬件找到5分钟内能达到的最优配置。
项目上线后迅速引爆社区,GitHub星标突破8万,成为2026年上半年AI开源社区传播最广的项目之一。后续还扩展出了autoresearch@home,让人类参与者与AI智能体共享实验,共同挑战排行榜。
更值得关注的是,autoresearch开创的这种AI改进AI的范式正在被广泛复制。DeepSeek研究员陈德里基于类似思路开发了Deli AutoResearch SKILL,仅用6天就生成了一篇完整的综述论文。超衍智能的自动化AI系统也在autoresearch的竞技场上刷新了SOTA记录。
如果你有一块NVIDIA GPU和Python 3.10+环境,现在就可以在GitHub上克隆这个项目试试。搭配Claude Code或Codex等代码生成模型,效果会更好。让AI帮你通宵做实验,这个想法听起来疯狂,但它确实已经在发生了。
项目地址:github.com/karpathy/autoresearch
45 浏览 0 评论
0 反应












