让AI的代码质量可测量:Agentic Engineering工作流

AI 写代码,你真的会检视它的输出吗?

我见过太多团队让 AI 一顿输出,结果呢?代码是跑通了,但线上 bug 一堆,没人知道为什么。这个 Skill 解决的就是这个问题——不是让 AI 写更多代码,而是让 AI 的代码质量可测量

这个 Skill 叫 Agentic Engineering,来自 GitHub 达人 @affaan-m,挂在 everything-claude-code 系列下面,在 LobeHub 上狂揽 340k+ stars,是目前最火的 Coding Agent 技能之一。


核心玩法:先写测试,再让 AI 实现

传统流程是:给需求 → AI 写代码 → 人工 review → 改 bug → 上线。

这套流程的问题是:review 全靠人的精力,AI 代码量一大,人根本 review 不过来

Agentic Engineering 的做法完全不同——先写一个”验收测试”,用它来定义”什么叫完成”。测试写好了,AI 来实现,跑测试看结果,对比基准失败特征,一目了然。

# 第一步:先写测试捕获期望行为
def test_user_authentication_flow():
    # 测试用例要清晰、单一、可自动化
    ...

# 第二步:跑测试 → 记录失败特征
# 第三步:让 AI 实现功能
# 第四步:再跑测试 → 看改善幅度
# 第五步:跑全量回归测试 → 查有没有引入新 bug

这个 Eval-First 循环,让 AI 的输出始终在一个可量化、可复验的框架里,而不是靠感觉。


任务分解:15 分钟单元法则

另一个常见问题是:一个需求太大,AI 拆不开,做着做着就跑偏了

这个 Skill 给了一个简单规则——15 分钟单元

  • 每个单元独立可验证
  • 每个单元只有一个主要风险
  • 每个单元有明确的”完成条件”

比如”加用户认证”这个需求,传统拆法是”2 小时工作量”,但 Agentic Engineering 的拆法是:

Task: Add user authentication
├─ Unit 1: Add password hashing (15 min, security risk)
├─ Unit 2: Create login endpoint (15 min, API contract risk)
├─ Unit 3: Add session management (15 min, state risk)
└─ Unit 4: Protect routes with middleware (15 min, auth logic risk)

每个子任务 15 分钟,有清晰的风险定位,review 起来也容易盯着看——security risk 就重点看加密逻辑,API contract risk 就重点看接口设计


模型路由:让贵模型只干高难度的活

很多人用 Claude Opus 处理所有代码任务,结果 Token 烧得快、速度慢、成本高。

Agentic Engineering 提出的模型路由策略很实用:

任务类型 推荐模型 典型场景
Haiku 级 Claude Haiku / GPT-4o-mini 变量重命名、格式调整、简单分类
Sonnet 级 Claude Sonnet / GPT-4o 功能实现、重构、写测试
Opus 级 Claude Opus 系统架构设计、复杂根因分析、多文件不变量检查

成本纪律:只有当下层模型出现明显推理gap 时,才升级到上层模型。不是不能用 Opus,而是要让它做真正需要 Opus 的事。


谁适合这个 Skill?

如果你是团队里管 AI 代码质量的,这个 Skill 直接可以落地——给团队的 AI coding workflow 装上一个评测框架,不用再靠”感觉还行”来判断代码质量。

如果你自己用 AI 写代码但总觉得输出不稳定,这套 eval-first 方法可以让你的调试效率提升一个量级。

如果你是 AI coding 工具的深度用户,模型路由策略可以帮你省下不少 Token 费用。


GitHubhttps://github.com/affaan-m/ecc

安装命令

npx skills add https://github.com/affaan-m/ecc --skill agentic-engineering

作者:沈星河 | 定位:AI 行业观察 / 综合盘点 / 主题合集


GitHub: https://github.com/affaan-m/ecc

评论区

0 条评论

登录后可评论。

沈星河 12 阅读