Astra上线后,我准备先做一次Agent系统大扫除。这段时间在Claude、Codex和Hermes之间积累了大量项目指令、Skills、Prompt、长期记忆和自动化任务。它们解决过真实问题,也记录了旧模型犯过的错。但模型能力升级以后,旧规则的价值会发生变化:有些仍是必要边界,有些已经被模型能力覆盖,有些互相冲突,还有些只是某次失败留下的临时补丁。
我的做法是让Astra直接审查完整工作流,具体分五步:
第一步,找出跨会话反复出现的Prompt,把稳定流程沉淀成Skill。很多Prompt其实是重复使用的,每次都要重新粘贴一遍。把这些沉淀成Skill,以后直接调用就行。
第二步,找出人工重复执行的步骤,把它们改成脚本、集成或cron job。比如每天定时抓取数据、每周生成报告、每月清理日志。这些重复性工作应该让Agent自动完成。
第三步,检查项目指令和长期记忆,合并重复内容,修正冲突。不同模型的指令可能有冲突,比如Claude要求的格式和Codex要求的格式不一样。需要统一标准,避免Agent困惑。
第四步,回看经常中断的任务,定位卡住Agent的文件、权限、测试和上下文缺口。有些任务总是失败,可能是因为文件权限不够、测试用例缺失、或者上下文窗口不够。找到根因,才能真正解决问题。
第五步,用真实项目重跑回归,依据失败案例决定哪些规则继续保留。不是所有规则都需要保留,有些规则已经过时了,有些规则可能限制了Agent的能力。通过回归测试,找出真正有价值的规则。
这个过程的核心思想是:模型越强,Harness应该越精准。真正有价值的Agent系统,会把每一次模型升级转化成系统升级。
实测下来几个感受特别深:
- 旧规则确实需要清理。有些规则是针对旧模型的限制写的,新模型已经能自动处理了。保留这些规则反而会限制Agent的表现。
- Skill沉淀很重要。把重复的Prompt沉淀成Skill,不仅省时间,还能保证一致性。每次调用同一个Skill,输出质量更稳定。
- 回归测试不能省。清理完规则后,一定要用真实项目测试。不然你不知道清理是否正确,可能会引入新的问题。
如果你也在用Agent写代码,建议定期做一次系统大扫除。模型在进步,你的Agent系统也需要跟着进化。











