让AI的代码质量可测量:Agentic Engineering工作流
用 AI 写代码,你真的会检视它的输出吗?
我见过太多团队让 AI 一顿输出,结果呢?代码是跑通了,但线上 bug 一堆,没人知道为什么。这个 Skill 解决的就是这个问题——不是让 AI 写更多代码,而是让 AI 的代码质量可测量。
这个 Skill 叫 Agentic Engineering,来自 GitHub 达人 @affaan-m,挂在 everything-claude-code 系列下面,在 LobeHub 上狂揽 340k+ stars,是目前最火的 Coding Agent 技能之一。
核心玩法:先写测试,再让 AI 实现
传统流程是:给需求 → AI 写代码 → 人工 review → 改 bug → 上线。
这套流程的问题是:review 全靠人的精力,AI 代码量一大,人根本 review 不过来。
Agentic Engineering 的做法完全不同——先写一个”验收测试”,用它来定义”什么叫完成”。测试写好了,AI 来实现,跑测试看结果,对比基准失败特征,一目了然。
# 第一步:先写测试捕获期望行为
def test_user_authentication_flow():
# 测试用例要清晰、单一、可自动化
...
# 第二步:跑测试 → 记录失败特征
# 第三步:让 AI 实现功能
# 第四步:再跑测试 → 看改善幅度
# 第五步:跑全量回归测试 → 查有没有引入新 bug
这个 Eval-First 循环,让 AI 的输出始终在一个可量化、可复验的框架里,而不是靠感觉。
任务分解:15 分钟单元法则
另一个常见问题是:一个需求太大,AI 拆不开,做着做着就跑偏了。
这个 Skill 给了一个简单规则——15 分钟单元:
- 每个单元独立可验证
- 每个单元只有一个主要风险
- 每个单元有明确的”完成条件”
比如”加用户认证”这个需求,传统拆法是”2 小时工作量”,但 Agentic Engineering 的拆法是:
Task: Add user authentication
├─ Unit 1: Add password hashing (15 min, security risk)
├─ Unit 2: Create login endpoint (15 min, API contract risk)
├─ Unit 3: Add session management (15 min, state risk)
└─ Unit 4: Protect routes with middleware (15 min, auth logic risk)
每个子任务 15 分钟,有清晰的风险定位,review 起来也容易盯着看——security risk 就重点看加密逻辑,API contract risk 就重点看接口设计。
模型路由:让贵模型只干高难度的活
很多人用 Claude Opus 处理所有代码任务,结果 Token 烧得快、速度慢、成本高。
Agentic Engineering 提出的模型路由策略很实用:
| 任务类型 | 推荐模型 | 典型场景 |
|---|---|---|
| Haiku 级 | Claude Haiku / GPT-4o-mini | 变量重命名、格式调整、简单分类 |
| Sonnet 级 | Claude Sonnet / GPT-4o | 功能实现、重构、写测试 |
| Opus 级 | Claude Opus | 系统架构设计、复杂根因分析、多文件不变量检查 |
成本纪律:只有当下层模型出现明显推理gap 时,才升级到上层模型。不是不能用 Opus,而是要让它做真正需要 Opus 的事。
谁适合这个 Skill?
如果你是团队里管 AI 代码质量的,这个 Skill 直接可以落地——给团队的 AI coding workflow 装上一个评测框架,不用再靠”感觉还行”来判断代码质量。
如果你自己用 AI 写代码但总觉得输出不稳定,这套 eval-first 方法可以让你的调试效率提升一个量级。
如果你是 AI coding 工具的深度用户,模型路由策略可以帮你省下不少 Token 费用。
GitHub:https://github.com/affaan-m/ecc
安装命令:
npx skills add https://github.com/affaan-m/ecc --skill agentic-engineering
作者:沈星河 | 定位:AI 行业观察 / 综合盘点 / 主题合集
GitHub: https://github.com/affaan-m/ecc
评论区
登录后可评论。