今天晚上就从四层清单的某一层开始动

今晚 harness 这条线聊了不少条——Claude Code auto mode classifier 炸了又补回来、Karpathy 的 agent 设计原则、TIRx Harness 给 agent 优化 GPU kernel 的环境、OpenAI Codex 默认打开审批、MongoDB 把 memory/runtime/governance 分清楚…

…这些放在一起看都指向同一个画面,但今天最值得拿出来的是一份系统化的总结。harness 工程领域的作者 avichawla 在 1600 多赞的一条里把整套东西分成了四层——今晚所有讨论加在一起刚好踩在这四层上,可以当今晚这条线最权威的收口用。

把四层摊开。Prompt engineering 是最里层——决定单次调用模型看到什么输入。今晚聊不到这一层,因为 prompt 是聊天框里用户、明星、AI 共同在调整的对象,不在这条线里。

Context engineering 是第二层——跨多次调用时模型看到什么。这一层今晚也没怎么出现,今天聊的内容大多在更外层。Harness engineering 是第三层——agent 怎么和环境、工具、边界打交道。

这一层今晚出现的密度最高:TIRx Harness、Codex Cloud、Codex Security Cloud、Codex CLI 默认审批、Omarchy agents panel、Claude Code classifier 失效——今晚所有 harness 类的讨论几乎全在这一层。

Loop engineering 是最外层——agent 怎么持续、什么时候停止、怎么复盘。这一层今天没怎么单聊,但提到 agent 死法和复盘的 Scarlett 那条都踩这一层。

把今晚聊的几条重新套这四层看一遍——Qwen-MM 把 skill 库做出来,让 agent 有工具;Codex CLI 默认打开审批,给敏感动作加几道闸;Karpathy 的笔记强调 agent 设计有可重复的方法,是 loop engineering 的具体视角;Scarlet 帖子讲 auto mode classifier 炸了是 harness 里分层判断做错了;TIRx Harness 给 agent 一个编译器环境,是 harness 里"环境可调优"的代表例子。

四层每一条讨论都在同一张全景图里,过去一周 AI 的进展可以一句话描述为——agent 的能力上限早就被模型框定,突破上限全靠 harness 这一层的进化。这既是过去几年为什么 harness 工程从冷门变成显学,也是今晚聊的几十条为什么都绕不开 harness 这个词的原因。

如果把模型层比作河流,水压决定水流多远;而 harness 决定水能不能从河里准确流到你想让水灌到的地方。模型今天够强了,再花大力气挑模型已经不划算;今天更值钱的工程工作是花时间把 harness 这层做扎实——把 agent 的工具、边界、状态、复盘机制都调到能用水平,再去调模型。

留一格清楚的边界:四层框架是给"做什么"分层的,不是给"做得好"打分的;具体到每一层,最佳实践还在演化,Karpathy 那条给了原则层方向,今晚聊的各帖给了具体落地层方向,四层之间还会有交叉。

最让人意外的是四层这么清晰地拆开后,每一层其实都不竞争,prompt 不抢 context、context 不抢 harness——它们是不同尺度上的工程问题,不是替代关系。这一点对个人开发者比对公司更重要:公司可以分工,个人只能自己分时。

给今天就在做 agent 相关工作的开发者一句落地的:今天打开你下一套 agent 工作流,按四层各过一遍——prompt 工程你最近一次更新是什么时候,context 工程的存储和拼接对不对,harness 的工具和边界够不够清晰,loop 的复盘和终止条件什么样。

每层一年用两个月检查一遍,比每次全栈重写更合算;今天四层过一遍的成本,是把整个 agent 套件按"可重复可维护"重塑一次成本的零头。今天晚上就从四层清单的某一层开始动,明天动另一层、月底动最后一层——四层分别用两个月时间调到能用,半年后你看自己的 agent 系统,质量和你今天自己写的不是同一个东西。

话题来源 @_avichawla 205.7K阅读 ❤️1605 x.com/…↗ 已改写,非原文转载
23 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单