时间:2026 年 9 月 26 日
地点:美国加州圣克拉拉(NVIDIA 总部)/ MIT / 南洋理工大学
人物:Song Han(MIT)、Haozhe Liu、Tian Ye(NVIDIA 研究团队)
事件详情:NVIDIA Labs 联合 MIT 与南洋理工大学开源 SoL-Pi 框架,通过自动研究循环让 AI 自主优化编码智能体的 Harness 层(控制层)。研究团队在 535 个可执行环境中探索 152 个方向、运行 3000+ 次实验、产生 60,000+ 次智能体-环境交互,最终从约 40 个候选机制中保留 4 个:动作融合(Action Fusion)把"修改文件+跑测试"合并为单次调用、在线上下文压缩(Online Context Compact)在子任务完成后按性价比裁剪上下文、观察打包(ObservationPack)将大文件输出替换为短摘要加按需索引、证据保留归约器(Evidence-Preserving Reducer)把长日志交给便宜模型并自动核验引用。在 51 任务 EdgeBench 评测中,SoL-Pi 在 GPT-5.6 Sol 和 Opus 5 上取得与 Pi 相当的性能,token 流量降低 44.7%-49.0%、API 成本下降约三分之一。
背景:编码智能体正从"辅助写代码"走向"无人值守自主探索",单次任务可长达 2-12 小时,token 消耗成为规模化的第一瓶颈。Anthropic 数据显示,智能体工作负载 token 消耗约为普通聊天的 4 倍,多智能体系统可达 15 倍。传统效率优化集中在模型层(注意力加速、量化、用更便宜的模型),SoL-Pi 改在 Harness 层下功夫,定位"省 token 不偷懒"的递归自我改进路径。
影响:SoL-Pi 以 MIT 协议开源,GitHub 已获 2.3k Star,Node.js 22.19+ 即可一键安装。在 EdgeBench 上,SoL-Pi 比 Codex 原生 Harness 便宜 50.0%,比 Claude Code 原生 Harness 便宜 54.3%,每小时可省 8.75-13.50 美元。但代价同样存在:Terminal-Bench 4 的 63 个 CPU 任务中,SoL-Pi 解出 15 个,Codex 与 Pi 各解 18 个;IMO 2026 仅解出 6 道题中的 3 道。研究团队下一步计划以 SoL-Pi 作为下一轮搜索的起点,让更便宜的 Harness 反哺研究循环,实现"递归效率改进"。
总结:英伟达通过 SoL-Pi 把 Harness 层拉进了自动优化的射程,证明模型外围的软件层才是 token 浪费的重灾区。短期看,企业可直接采用 4 个机制把编码 Agent 账单砍半;长期看,harness-level 编译器、schema 最小化器、observation 规划器将成为 AI Infra 新蓝海,重塑 Agent 执行框架的成本结构。
参考来源:
1. The Decoder(原始报道):https://the-decoder.com/nvidias-sol-pi-system-cuts-coding-agent-token-usage-nearly-in-half-by-optimizing-the-harness/
2. NVIDIA 官方项目页:https://nvlabs.github.io/SoL-Pi
3. arXiv 论文 2609.20519:https://arxiv.org/abs/2609.20519
4. BestBlogs 中文深度解读:https://www.bestblogs.dev/status/2101104385384497425
5. AGI Hunt 英文版:https://agihunt.info/en/p/1a0cdb61b823c97d434f41cfbed
6. BlockBeats 中文快讯:https://www.theblockbeats.info/flash/366622
7. The Next Gen Tech Insider:https://thenextgentechinsider.com/pulse/nvidia-launches-sol-pi-to-slash-token-usage-and-costs-for-coding-agents
8. CSDN 技术博客:https://blog.csdn.net/qq_45831510/article/details/166121262







