Claude Autoresearch Skill:把 Claude Code 变成自主迭代引擎
Claude Autoresearch Skill:把 Claude Code 变成自主迭代引擎,修改→验证→保留/丢弃循环永不停止
功能与原则
Claude Autoresearch Skill 基于 Karpathy 的 autoresearch 思想,为 Claude Code、OpenCode、OpenAI Codex 提供一套自主迭代框架。其核心原则简单而有力:Set the GOAL → The agent runs the LOOP → You wake up to results。不同于传统 AI 助手的单次生成模式,autoresearch 将 AI 编程变成一个闭环:设定目标、自动化度量化验证、每次迭代只做一个改动、更好则保留、更差则自动回退。
该 Skill 包含 14 条命令、9 个安全钩子,典型调用相比单体 SKILL.md 减少 95% token 消耗(从 ~100K tokens/次降至 ~5–8K tokens/次)。v2.2.0 版本新增 Autonomous Orchestrator,用户只需用自然语言描述目标,系统自动分类目标类型、推导成功谓词、确认一次后自主循环执行直到达成。
认可度
- GitHub Star:5518(截至 2026-08-01)
- Fork:418
- 语言:Shell
- 今日 GitHub Trending 出现,项目持续活跃维护
- 近期更新:2026-08-01 仍有提交记录
链接
GitHub:https://github.com/uditgoenka/autoresearch
原作者
@uditgoenka(GitHub: uditgoenka),独立开发者,专注于 AI Agent 自动化工具链。其 X/Twitter 账号 @iuditg 也可关注。
介绍
Karpathy 的 autoresearch 论文曾展示:一个 630 行的 Python 脚本可以自主改进 ML 模型,一晚上跑 100 个实验,靠的就是三个要素——一个指标、有限范围、快速验证、自动回滚、git 作为记忆。
Claude Autoresearch 将这套方法泛化到任意领域:不只是机器学习,代码、内容、营销、销售、HR、DevOps,任何能用数字衡量的目标都可以。系统设计了一套六阶段主循环(PLAN → LOOP → DEBUG → FIX → SECURE → SHIP),每个阶段对应独立命令,环环相扣。
v2.1.0 是架构重大升级。原来 813 行、每次调用消耗约 100K tokens 的单体 SKILL.md,被替换为:一个 41 行的路由文件 + 12 个自包含命令文件(每个 94–120 行,约 5–8K tokens/次),实现 95% token 削减而能力保持不变。
特点
- Karpathy 方法论落地:约束 + 量化指标 + 自主迭代 = 复合收益,ML 代码变体验证可套用到任意工程目标
- 14 条独立命令:覆盖 plan、debug、fix、security、ship、probe、scenario、predict、reason、learn、improve、evals、regression 等全生命周期
- v2.2.0 Autonomous Orchestrator:自然语言目标输入 → 自动分类 → 推导成功谓词 → 确认一次 → 自主循环,用户只需说”帮我修掉这个 bug”,剩下的全部自动完成
- 95% token 降低:分片式 SKILL.md 架构,每次只加载相关命令文件,大幅减少上下文消耗
- 安全回滚机制:每次改动前 git commit,验证失败自动 revert,不污染代码库
使用方法
安装:
Claude Code:
/plugin marketplace add uditgoenka/autoresearch
或通过 npx:
npx skills add uditgoenka/autoresearch -g
Orchestrator 模式(自然语言目标):
/autoresearch help me fix the login bug
系统自动分类目标类型(如 fix-broken),推导成功谓词(如运行测试预期通过),确认一次后进入自主循环,直到测试全部通过或达到 50 次迭代上限。
经典循环模式(已定义指标):
/autoresearch Metric: <你的指标> Verify: <验证命令>
其他常用命令:
/autoresearch plan # 制定迭代计划
/autoresearch debug # 追踪并修复 bug
/autoresearch fix # 自动修复错误
/autoresearch security # 运行 STRIDE OWASP 安全检查
/autoresearch ship # 部署发布阶段
/autoresearch regression # 基线对比验证
使用场景与人群
适用场景:
– 代码改进:优化性能、修复 bug、提升可读性
– ML 模型迭代:自动跑实验、调超参、验证指标提升
– 内容优化:营销文案 A/B 测试驱动改进
– 安全审计:自动化红队检查和 OWASP 验证
– 任何有明确量化指标的迭代任务
目标用户:
– Claude Code / OpenCode / Codex 重度用户
– 需要 AI 辅助进行持续改进的工程师
– 机器学习研究员(Karpathy autoresearch 方法论爱好者)
– 对 AI 自动化迭代有需求的开发者
输入与输出案例
案例一:修 Bug
Input:
/autoresearch help me fix the login bug
Output(系统回复示例):
Goal Classification: fix-broken
Success Predicate: pytest tests/test_auth.py::test_login -v returns 0
Pipeline: [debug → fix → verify]
Cycle Budget: 50 max cycles
[Round 1] debug → Found: JWT token not refreshed on re-login
[Round 2] fix → Modified auth/token.py:55
[Round 3] verify → pytest tests/test_auth.py::test_login ✓ PASSED
Goal achieved in 3 cycles.
案例二:自主优化性能
Input:
/autoresearch Metric: page_load_time < 200ms Verify: lighthouse --only-categories=performance
Output:
Baseline: page_load_time = 340ms
[Iteration 1] → 295ms (kept)
[Iteration 2] → 268ms (kept)
[Iteration 3] → 241ms (kept)
[Iteration 4] → 198ms ✓ (目标达成)
Total: 4 cycles, cumulative improvement 42%
评论区
登录后可评论。