AI帮你通宵调参,睡醒收获SOTA——autoresearch评测

你有没有过这种经历——睡前跑了个实验调参,一觉醒来发现跑了 100 多轮,报告整整齐齐摆在桌上?

这就是 Karpathy 年初放出的 autoresearch 核心愿景。现在有人把它做成了 Claude Code 的 Skill,叫 autoresearch,连 OpenCode 和 Codex 也能用。


原理极简,效果炸裂

整个思路就三句话:定目标 → 机械执行 → 自动筛选

你给它一个量化指标(比如准确率、F1 分数、响应延迟),然后交给循环:改代码 → 跑验证 → 效果好就保留,效果差就回滚。Agent 自个儿在那儿迭代,你睡觉,它加班。


14 个子命令,开发全流程覆盖

这个 Skill 内置了 14 个子命令,基本把开发链路全覆盖了:

核心循环: planloopverifyfixkeep/discard

质量保障: debug(追踪 Bug)、fix(修复错误)、secure(安全审计,附带 9 个 OWASP 安全钩子)、ship(发版)

高级用法: probe(探测需求)、scenario(构造边缘 case)、predict(5-专家 swarm 预测)、learn(文档生成)、reason(辩论收敛)

简单说,就是把一个资深开发团队的日常工作流程,压缩进了一个可以 autonomous loop 的工具


真实场景怎么用

举几个我实测下来最有效的场景:

  1. 模型调参:喂一个评测脚本,设好 metric,睡觉。起来看哪组参数最稳,直接用。
  2. 代码重构验证:改完架构,跑回归测试集,autoresearch 自动判断改坏了没。
  3. 安全审计:接 secure 命令,自动跑 OWASP 检查,不用再手动扫一遍。
  4. Prompt 迭代:LLM 输出质量波动大?设一个自动评分脚本,Agent 帮你把 prompt 调几十遍。

缺点也要说

  • 上手有门槛:你需要先有一个可量化的 metric,纯主观的”好不好用”它帮不了你。
  • 资源消耗大:一晚上跑上百轮,看你机器性能,GPU/时间成本要考虑。
  • 适合开发者:不是给普通用户用的,需要能写评测脚本。

安装 & 快速上手

# 克隆仓库
git clone https://github.com/thewiningturtle/autoresearch.git
cd autoresearch

# 阅读 README,按指示配置 Claude Code / OpenCode / Codex
# 核心就是两步:设 GOAL + 跑 /autoresearch loop

项目完全开源,基于 Karpathy 的原始 autoresearch 思路演进,社区活跃度高。


一句话总结: 如果你受够了手动调参、反复跑实验、凌晨三点盯结果,这款把 AI 变成”24 小时开发实习生”的工具,值得一试。

GitHub:https://github.com/thewiningturtle/autoresearch


GitHub: https://github.com/thewiningturtle/autoresearch

评论区

0 条评论

登录后可评论。

江望 14 阅读