Claude Autoresearch Skill:把 Claude Code 变成自主迭代引擎

Claude Autoresearch Skill:把 Claude Code 变成自主迭代引擎,修改→验证→保留/丢弃循环永不停止

功能与原则

Claude Autoresearch Skill 基于 Karpathy 的 autoresearch 思想,为 Claude Code、OpenCode、OpenAI Codex 提供一套自主迭代框架。其核心原则简单而有力:Set the GOAL → The agent runs the LOOP → You wake up to results。不同于传统 AI 助手的单次生成模式,autoresearch 将 AI 编程变成一个闭环:设定目标、自动化度量化验证、每次迭代只做一个改动、更好则保留、更差则自动回退。

该 Skill 包含 14 条命令、9 个安全钩子,典型调用相比单体 SKILL.md 减少 95% token 消耗(从 ~100K tokens/次降至 ~5–8K tokens/次)。v2.2.0 版本新增 Autonomous Orchestrator,用户只需用自然语言描述目标,系统自动分类目标类型、推导成功谓词、确认一次后自主循环执行直到达成。

认可度

  • GitHub Star:5518(截至 2026-08-01)
  • Fork:418
  • 语言:Shell
  • 今日 GitHub Trending 出现,项目持续活跃维护
  • 近期更新:2026-08-01 仍有提交记录

链接

GitHub:https://github.com/uditgoenka/autoresearch

原作者

@uditgoenka(GitHub: uditgoenka),独立开发者,专注于 AI Agent 自动化工具链。其 X/Twitter 账号 @iuditg 也可关注。

介绍

Karpathy 的 autoresearch 论文曾展示:一个 630 行的 Python 脚本可以自主改进 ML 模型,一晚上跑 100 个实验,靠的就是三个要素——一个指标、有限范围、快速验证、自动回滚、git 作为记忆。

Claude Autoresearch 将这套方法泛化到任意领域:不只是机器学习,代码、内容、营销、销售、HR、DevOps,任何能用数字衡量的目标都可以。系统设计了一套六阶段主循环(PLAN → LOOP → DEBUG → FIX → SECURE → SHIP),每个阶段对应独立命令,环环相扣。

v2.1.0 是架构重大升级。原来 813 行、每次调用消耗约 100K tokens 的单体 SKILL.md,被替换为:一个 41 行的路由文件 + 12 个自包含命令文件(每个 94–120 行,约 5–8K tokens/次),实现 95% token 削减而能力保持不变。

特点

  • Karpathy 方法论落地:约束 + 量化指标 + 自主迭代 = 复合收益,ML 代码变体验证可套用到任意工程目标
  • 14 条独立命令:覆盖 plan、debug、fix、security、ship、probe、scenario、predict、reason、learn、improve、evals、regression 等全生命周期
  • v2.2.0 Autonomous Orchestrator:自然语言目标输入 → 自动分类 → 推导成功谓词 → 确认一次 → 自主循环,用户只需说”帮我修掉这个 bug”,剩下的全部自动完成
  • 95% token 降低:分片式 SKILL.md 架构,每次只加载相关命令文件,大幅减少上下文消耗
  • 安全回滚机制:每次改动前 git commit,验证失败自动 revert,不污染代码库

使用方法

安装:

Claude Code:

/plugin marketplace add uditgoenka/autoresearch

或通过 npx:

npx skills add uditgoenka/autoresearch -g

Orchestrator 模式(自然语言目标):

/autoresearch help me fix the login bug

系统自动分类目标类型(如 fix-broken),推导成功谓词(如运行测试预期通过),确认一次后进入自主循环,直到测试全部通过或达到 50 次迭代上限。

经典循环模式(已定义指标):

/autoresearch Metric: <你的指标> Verify: <验证命令>

其他常用命令:

/autoresearch plan        # 制定迭代计划
/autoresearch debug       # 追踪并修复 bug
/autoresearch fix         # 自动修复错误
/autoresearch security    # 运行 STRIDE OWASP 安全检查
/autoresearch ship        # 部署发布阶段
/autoresearch regression  # 基线对比验证

使用场景与人群

适用场景:
– 代码改进:优化性能、修复 bug、提升可读性
– ML 模型迭代:自动跑实验、调超参、验证指标提升
– 内容优化:营销文案 A/B 测试驱动改进
– 安全审计:自动化红队检查和 OWASP 验证
– 任何有明确量化指标的迭代任务

目标用户:
– Claude Code / OpenCode / Codex 重度用户
– 需要 AI 辅助进行持续改进的工程师
– 机器学习研究员(Karpathy autoresearch 方法论爱好者)
– 对 AI 自动化迭代有需求的开发者

输入与输出案例

案例一:修 Bug

Input:

/autoresearch help me fix the login bug

Output(系统回复示例):

Goal Classification: fix-broken
Success Predicate: pytest tests/test_auth.py::test_login -v returns 0
Pipeline: [debug → fix → verify]
Cycle Budget: 50 max cycles

[Round 1] debug → Found: JWT token not refreshed on re-login
[Round 2] fix → Modified auth/token.py:55
[Round 3] verify → pytest tests/test_auth.py::test_login ✓ PASSED
Goal achieved in 3 cycles.

案例二:自主优化性能

Input:

/autoresearch Metric: page_load_time < 200ms Verify: lighthouse --only-categories=performance

Output:

Baseline: page_load_time = 340ms
[Iteration 1] → 295ms (kept)
[Iteration 2] → 268ms (kept)
[Iteration 3] → 241ms (kept)
[Iteration 4] → 198ms ✓ (目标达成)

Total: 4 cycles, cumulative improvement 42%

GitHub: https://github.com/uditgoenka/autoresearch

评论区

0 条评论

登录后可评论。

Skill超级捕获手 10 阅读