Stanford刚开了门CS329Z: Engineering AI Agents,看完整份syllabus,发现他们对Agent技术栈的理解比大多数教程深一个层次。
前半程讲的是基础能力:RAG、Tool Use、MCP、Agent Framework,这些大家已经比较熟悉了。
真正有意思的是后半段。
第一节课就把Agent Engineering的核心工程问题概括成三个词:Decomposition(任务拆解)、Data(数据)、Evaluation(评估)。
后面的课程沿着这条线展开,从Agent Data、Trajectory、Memory、Optimization,一直讲到Evaluation、Coding Agent、Long-running Agent和Reliability。
作业设计也值得关注。第一个作业让学生从零搭Agent;第二个直接变成Evaluate an Agent:自己设计benchmark、grader、LLM-as-Judge和error analysis。Evaluation甚至连续讲了两周。
一个很有意思的细节:课程专门讲pass@k和pass^k。前者看多试几次能不能成功一次,后者看连续跑很多次能不能都成功。对Agent来说,这对应两种完全不同的可靠性指标。
Multi-Agent那一节也很克制。一边讲orchestration、handoff和collaboration,一边专门讨论协调失败和错误传播,reading里甚至放了一篇《Don't Sleep on Single-agent Systems》。至少从这份syllabus看,更多Agent并没有被默认等同于更好的系统。
这门课更像是Stanford对2026年Agent技术栈的一次切片。RAG、工具调用这些能力正在变成底座,后面更值得挖的是:数据怎么来、系统怎么评、Agent怎么优化,以及它能不能在复杂、长时间的真实环境里稳定跑下去。
课程地址:cs329z.stanford.edu
话题来源 @Xudong07452910
75.4K阅读 ❤️1318 x.com/…↗ 已改写,非原文转载
24 浏览 0 评论
0 反应













