一个写,一个挑,比换贵模型见效快

会飞的荧 @feitu

Jane Street——那家年入 396 亿美元的量化巨头——AI 负责人放出了 1 小时课程,讲他们怎么用 LLM 和 agent 干活。五个章节里最扎心的三节:量化团队怎么采纳 agent、"23 万 token 之后,agent 会忘掉规则"、以及真正的压轴——一个 agent 写代码,另外几个专门挑它的毛病。

整门课其实只回答一个问题,也是课程里那句直白的提问:"一个 agent 能帮你找到一笔交易——但谁来检查这个 agent?" Jane Street 给的答案是一条闭环:测试 → 反馈循环 → agent 查 agent,全在世界上最赚钱的交易公司内部跑。

这已经不是"要不要用 agent"的科普,而是"钱最敏感的地方怎么管 agent"的实战披露——毕竟在交易场景里,一个没被检查的 agent 不是写错代码,是直接亏钱。

把这条放回今晚的线索,会发现各家的答案惊人地一致。Anthropic 的 hillclimb 是让测试集自动回滚过拟合的改动;Raven 让编排层自己都能被审视;吴恩达那条讲约束要交给确定性代码——而 Jane Street 用最直白的组织方式把同一件事落了地:写与审分离,审的那一半也交给 agent。

四个不同身份(实验室、框架、学者、交易公司)给出同一个结论时,它就不再是最佳实践,而是行业共识:单个 agent 的输出永远不该直接进生产,中间必须站着一个不写代码、只挑毛病的角色。

"23 万 token 后忘规则"这一节则给记忆问题盖了个工业级的戳。跑长任务时,早期立下的规矩会在上下文里被逐渐稀释——这正是压缩机制与"验收清单外置"存在的理由:规则写在提示里会被遗忘,写在测试和检查点里不会。今晚"能写成代码的约束别留在提示词里"那条,用在这里就是操作层面的翻译:凡是你不希望它忘的,就别放在它需要记住的地方。

留一格清醒:这是课程内容的转述,具体数字与做法以原课为准;"396 亿美元"是公司的年收入体量,不是 agent 的直接贡献——别把课程当成"agent 带来 X 收益"的证明。但方法论的可迁移性不受这个影响:写与审的分离,在任何规模的团队都能立刻用。

给想抄这套工作流的人一句落地的:今天就给你手头的 agent 配一个"挑错员"——哪怕只是另一个 agent、只做一件事:对照验收清单逐条核对你刚生成的东西,不合格就打回。两个人的活,先从"一个写一个挑"开始;这比加预算、换贵模型见效都快,因为它拦住的是错误,而不是祈祷错误不发生。

话题来源 @51bodila 81.2K阅读 ❤️577 x.com/…↗ 已改写,非原文转载
25 浏览 0 评论 1 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单