大多数所谓递归自我改进系统其实是半闭环:它们默认存在一个黄金验证器,一个外部的、…

AI大土豆 @suanwan
大多数所谓递归自我改进系统其实是半闭环:它们默认存在一个黄金验证器,一个外部的、可靠的评分信号,持续告诉模型方向对不对。一旦这个外部老师被拿掉,Agent能否自己闭合这个环,是一个悬而未决的问题。 ByteDance Seed和TokenWave发布的Self-Developing Agents,就是要实现从半闭环到全闭环的递归自我改进。团队把闭环RSI拆成三个问题: 1 目标形成:模糊目标如何变成具体行动? 2 经验整合:没有老师时,能否自我评判并从经验中学习? 3 系统整合:改进能否沉淀到行动方式中并持续? 每个基准的共同设计原则:在Agent看不到的held-out评估上检验,不是看它自己声称的进步。 三个基准分别是: Aspire(选什么去改进)给Agent一个宽泛目标,不告知下游任务与最终评估。Agent自行决定学什么、怎么学。配套6个能力目标、520题封闭专家评测集、支持权重与harness更新的最小交互环境、48组模糊目标vs明确任务配对轨迹。 S3Gym(能否从经验中学习)7个带可执行验证器的游戏(国际象棋、扫雷、贪吃蛇、俄罗斯方块、PvZ、Nullify、Trust)。把过程拆为Self-Testing/Self-Judging/Self-Improvement,比较三种经验载体:原始历史ICL、摘要记忆、参数训练。 HarnessDev(改进能否持久)让模型从零构建一个可运行的agent harness,再依据下游执行反馈演化它。评估对象是harness本身在held-out任务上的表现,并额外检验固定执行器下演化是否仍然有效。 实验发现: 1 目标形成:模糊目标改变的是搜索过程,不是能力。30个配置x目标单元中,28个产出了checkpoint,仅2个超过基座模型,只有1个达到保留阈值。结论:跑完更新循环不等于目标能力提升。 2 经验整合:不存在通用的经验路径。摘要记忆与原始历史各胜3个游戏,一个打平。参数更新不稳定:Trust在多数checkpoint上提升,PvZ却从23跌到6且不再恢复,原因未知。自我评判几乎不能预测下一步增益,这是对无老师自学最直接的否定证据。 3 系统整合:可运行的harness里存在死机制。LLM生成的18个harness全部可运行,但其中一些状态/记忆机制在代码中声明、运行时从未触发。64次版本切换中,Agent主要修改执行流程与工具,很少触碰状态管理与验证。可见反馈与held-out分数方向一致的仅34/64(53.1%),接近随机。 团队的方法论主张:在Agent看不见的评估上检验目标、用下一次决策检验经验、在固定执行器+held-out任务上检验演化。项目地址:self-developing-agents.github.io
话题来源 @shao__meng ❤️23 x.com/…↗ 已改写,非原文转载
17 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单