NVIDIA刚刚开源了一个挺有意思的东西:SoL-Pi。
它不是从零做了一套新的Agent Harness,而是基于Pi做了一套Harness效率增强层,用MIT License开源。
这个项目的重点是让Agent自动研究怎么优化Agent自己的Harness。
他们搭了535个可执行训练环境,其中495个来自真实GitHub Issue-PR,另外40个是带Verifier的合成任务,然后让Auto-Research Loop不断提出新的Harness改进方案、实现、跑实验、验证,最后只有大约1/40的想法能活下来。
最终这个管线自动找出了四个优化:
- Action Fusion:改完代码直接把测试/运行合并进同一次Tool Call,减少一次模型往返。
- Online Context Compact:不等Context快爆了再压缩,而是在子任务完成节点主动判断是否Compact。
- ObservationPack:巨大的Tool Result不再每轮塞回Context,只保留索引,需要时精确取回。
- Evidence-Preserving Reducer:长Log先交给更便宜的Agent阅读压缩,同时对引用证据逐条验证。
效果也非常好:
相比原始Pi,SoL-Pi Token使用量降低45%–49%,成本降低约1/3,同时保留约94%的平均任务得分;
相比模型自己的原生Harness,Token少35%–64%,按API标价计算成本低50%–54%。
在GPT-5.6 Sol上,SoL-Pi的EdgeBench得分甚至超过了原生Codex Harness。
这其实和现在DeepSeek Harness的方向撞到一起了:
模型越来越强之后,下一层Scaling开始发生在Harness。
但Nvidia的SoL-Pi又往下走了一次一层:
不只是人优化Harness,而是让Agent自己跑Research Loop,找到更好的Harness,再拿这个Harness去跑下一轮Research。
他们自己给这个方向起名叫Efficiency for Efficiency。
更高效的Harness → 更便宜的Auto-Research → 同样预算跑更多实验 → 再找到更高效的Harness。
模型之外的RSI,已经开始有点具体的样子了。
17 浏览 0 评论
0 反应













