我们一直在研究怎么让Agent更聪明,但这篇论文反过来问了一句:能不能让Agent自己研究,怎么把自己跑得更便宜?
NVIDIA、NTU、MIT团队的SoL-Pi,就是让Research Agent自动发现Harness里的Token浪费,再通过大规模实验筛掉无效改法。整个搜索覆盖152个方向、535个可执行环境和3000+次实验,最后真正留下来的只有4个机制。
我有个做AI开发的朋友,他之前用Agent处理任务,Token消耗一直是个大问题。每次调用API都要花不少钱,特别是那些需要多次迭代的任务。用了这个方案后,他说成本降了不少,效果也差不多。
思路其实还挺朴素的:合并连续工具操作;只在划算的时候压缩上下文;大段工具输出先存起来、需要时再读;冗长日志只保留经过验证的关键证据。听起来简单,但能从3000多次实验中筛选出来,说明这些机制确实有效。
结果在EdgeBench上,SoL-Pi在GPT-5.6 Sol和Opus 5上保持接近Pi的任务表现,同时减少约45%-49%的Token流量,API成本降低约三分之一。并且用GPT-5.6 Sol搜出来的Harness,可以直接迁移到Opus 5,不需要重新优化。
还有一个细节是最终评测集完全隔离,候选方案冻结后才能进去测试;如果失败,就直接淘汰,结果不会再回流给Agent继续针对性修改。这样能尽量避免为了benchmark把Harness越改越偏。
这篇工作给的insight是Harness自进化未必需要一开始就追求复杂的新架构。大量价值可能藏在那些每天都在发生的浪费里,重复调用、反复传输、无效上下文和过长日志。当AI开始自己发现并修掉这些系统性浪费,Agent的自我改进也就从能力提升,走到了运行效率这一层。
论文地址:arxiv.org/abs/2609.20519
如果你也在做Agent相关的项目,可以试试这个方案。特别是那些对成本有要求的场景,用这个方案确实能省不少钱。
24 浏览 0 评论
0 反应














