AI帮你通宵调参,睡醒收获SOTA——autoresearch评测
你有没有过这种经历——睡前跑了个实验调参,一觉醒来发现跑了 100 多轮,报告整整齐齐摆在桌上?
这就是 Karpathy 年初放出的 autoresearch 核心愿景。现在有人把它做成了 Claude Code 的 Skill,叫 autoresearch,连 OpenCode 和 Codex 也能用。
原理极简,效果炸裂
整个思路就三句话:定目标 → 机械执行 → 自动筛选。
你给它一个量化指标(比如准确率、F1 分数、响应延迟),然后交给循环:改代码 → 跑验证 → 效果好就保留,效果差就回滚。Agent 自个儿在那儿迭代,你睡觉,它加班。
14 个子命令,开发全流程覆盖
这个 Skill 内置了 14 个子命令,基本把开发链路全覆盖了:
核心循环: plan → loop → verify → fix → keep/discard
质量保障: debug(追踪 Bug)、fix(修复错误)、secure(安全审计,附带 9 个 OWASP 安全钩子)、ship(发版)
高级用法: probe(探测需求)、scenario(构造边缘 case)、predict(5-专家 swarm 预测)、learn(文档生成)、reason(辩论收敛)
简单说,就是把一个资深开发团队的日常工作流程,压缩进了一个可以 autonomous loop 的工具。
真实场景怎么用
举几个我实测下来最有效的场景:
- 模型调参:喂一个评测脚本,设好 metric,睡觉。起来看哪组参数最稳,直接用。
- 代码重构验证:改完架构,跑回归测试集,autoresearch 自动判断改坏了没。
- 安全审计:接
secure命令,自动跑 OWASP 检查,不用再手动扫一遍。 - Prompt 迭代:LLM 输出质量波动大?设一个自动评分脚本,Agent 帮你把 prompt 调几十遍。
缺点也要说
- 上手有门槛:你需要先有一个可量化的 metric,纯主观的”好不好用”它帮不了你。
- 资源消耗大:一晚上跑上百轮,看你机器性能,GPU/时间成本要考虑。
- 适合开发者:不是给普通用户用的,需要能写评测脚本。
安装 & 快速上手
# 克隆仓库
git clone https://github.com/thewiningturtle/autoresearch.git
cd autoresearch
# 阅读 README,按指示配置 Claude Code / OpenCode / Codex
# 核心就是两步:设 GOAL + 跑 /autoresearch loop
项目完全开源,基于 Karpathy 的原始 autoresearch 思路演进,社区活跃度高。
一句话总结: 如果你受够了手动调参、反复跑实验、凌晨三点盯结果,这款把 AI 变成”24 小时开发实习生”的工具,值得一试。
GitHub:https://github.com/thewiningturtle/autoresearch
评论区
0 条评论
登录后可评论。