NVIDIA刚刚开源了一个挺有意思的东西:SoL-Pi。 它不是从零做了一套新的…

NVIDIA刚刚开源了一个挺有意思的东西:SoL-Pi。

它不是从零做了一套新的Agent Harness,而是基于Pi做了一套Harness效率增强层,用MIT License开源。

这个项目的重点是让Agent自动研究怎么优化Agent自己的Harness。

他们搭了535个可执行训练环境,其中495个来自真实GitHub Issue-PR,另外40个是带Verifier的合成任务,然后让Auto-Research Loop不断提出新的Harness改进方案、实现、跑实验、验证,最后只有大约1/40的想法能活下来。

最终这个管线自动找出了四个优化:

  1. Action Fusion:改完代码直接把测试/运行合并进同一次Tool Call,减少一次模型往返。
  2. Online Context Compact:不等Context快爆了再压缩,而是在子任务完成节点主动判断是否Compact。
  3. ObservationPack:巨大的Tool Result不再每轮塞回Context,只保留索引,需要时精确取回。
  4. Evidence-Preserving Reducer:长Log先交给更便宜的Agent阅读压缩,同时对引用证据逐条验证。

效果也非常好:
相比原始Pi,SoL-Pi Token使用量降低45%–49%,成本降低约1/3,同时保留约94%的平均任务得分;
相比模型自己的原生Harness,Token少35%–64%,按API标价计算成本低50%–54%。
在GPT-5.6 Sol上,SoL-Pi的EdgeBench得分甚至超过了原生Codex Harness。

这其实和现在DeepSeek Harness的方向撞到一起了:

模型越来越强之后,下一层Scaling开始发生在Harness。

但Nvidia的SoL-Pi又往下走了一次一层:
不只是人优化Harness,而是让Agent自己跑Research Loop,找到更好的Harness,再拿这个Harness去跑下一轮Research。

他们自己给这个方向起名叫Efficiency for Efficiency。

更高效的Harness → 更便宜的Auto-Research → 同样预算跑更多实验 → 再找到更高效的Harness。

模型之外的RSI,已经开始有点具体的样子了。

项目地址:github.com/NVlabs/SoL-Pi

话题来源 @MaxForAI 49.1K阅读 ❤️639 x.com/…↗ 已改写,非原文转载
18 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单