并行 agent 跑完就完事了?谁来为结果负责——oh-my-agent 体验
并行 agent 跑得飞起,但你怎么知道它真的把活干对了?
不是阴阳怪气,是认真的:现在让 agent 写代码、跑测试、部署服务都不是难事了。但问题是——它说”测试全过了”,你就信了?它说”功能完成了”,你真的敢直接合进去?
oh-my-agent 就是来解决这个问题的。它不是帮你跑 agent 的工具,而是帮你验证 agent 到底干了什么的框架。
它怎么验证?
三个核心机制:
Stop Hook——你的 agent 想收工?先把你项目里的 typecheck / test / lint 跑一遍,脚本必须 exit 0,否则 session 别想结束。agent 嘴上说”搞定了”没用,工具链不认。
Gate 命令——判断一个工作流是否真正执行完毕,不是靠 agent 自己汇报,而是看它必须留下的产物(artifact)是否存在。比如”构建 Docker 镜像”的 gate 就检查镜像 tag 有没有出现在本地 registry 里。结果是 JSON 格式的判定,不是文字描述。
Independent Judge——用独立的 fresh context 重新验证每一条标准,包括那些已经通过的。用同一轮对话里的上下文来验证自己?裁判不能和运动员是同一个人。
所有 gate 的判定结果都记在只追加的事件日志里,事后可查、可审计、可复盘。
跨 runtime 统一质量门禁
这是另一个亮点——oh-my-agent 不绑定某一个 IDE 或工具链。它把 .agents/ 目录下的配置分发到 Claude Code、Cursor、Codex、OpenCode 等 10+ 个运行时,一个项目全员统一质量标准,不用每套工具链各自维护一套 CI 逻辑。
适用场景
- 团队多人协作:有人用 Claude Code,有人用 Cursor,有人用命令行,代码质量门禁标准一致
- CI/CD 集成:agent 跑完必须留下可验证的产物才能进下一步,防止”裸跑”
- 可信度要求高的任务:比如数据库迁移、基础设施变更,agent 说得不算,gate 产物说了算
安装使用
一行命令搞定:
# macOS/Linux
curl -fsSL https://raw.githubusercontent.com/first-fluke/oh-my-agent/main/cli/install.sh | bash
# 或用 bun 直接跑
bunx oh-my-agent@latest
支持 Microsoft APM(Agent Package Manager)安装,也可以直接装单个 skill。
总结
oh-my-agent 的定位很清晰:不是让你的 agent 跑得更快,而是让你的 agent 跑得更可信。并行化早就不是门槛了,真正的问题是——跑了这么多 agent,谁来为结果负责?这个框架给出了答案。
GitHub: https://github.com/first-fluke/oh-my-agent
评论区
登录后可评论。