时间:2026年7月29日
地点:美国旧金山(线上发布)
人物:OpenAI研究团队、GPT-5.6 Sol
事件详情:OpenAI于7月29日发布技术复盘,解释GPT-5.6 Sol在ARC-AGI-3公开任务集上的得分为何被通用评测框架低估。官方对比显示,使用官方通用框架时得分为13.3%;在Responses API中开启保留推理和上下文压缩两项设置后,得分升至38.3%,约为原来的近三倍,同时输出Token消耗降至六分之一。保留推理让模型可在多回合间复用历史思考,压缩则用更结构化的总结替代滚动截断,从而避免早期经验被截掉丢失。
背景:ARC-AGI-3由ARC Prize推出,用陌生二维游戏考察智能体的探索、规则归纳、长期规划和持续学习,不提供自然语言操作说明,采用相对人类行动效率(RHAE)作为评分标准,分数同时受通关率和动作效率影响。ARC官方提供的公共游戏玩家回放数据显示,普通人类在25个演示环境上的平均得分约为48%。
影响:
- 说明基准测试结果不仅取决于模型权重,也取决于API配置、提示和智能体运行框架
- 为多轮工具调用应用提供实践方向,保留推理与压缩可能同时改善长任务表现和Token效率
- 提醒开发者比较不同模型时,应明确记录运行框架与记忆策略,避免把工程差异误判为模型能力差异
- 上下文管理从辅助功能升级为智能体基础设施,可能影响企业部署成本与可靠性
- 38.3%是OpenAI自建Responses API框架下的结果,不等于模型内在能力普遍提升三倍
总结:这次复盘揭示了智能体评测中模型能力和运行框架的耦合。对多轮工具调用应用而言,保留推理并用压缩替代粗暴截断,可能同时改善长任务表现、减少重复推理和Token成本。不过,38.3%来自OpenAI自建Responses API框架,不能直接与其他模型成绩横向等同,评测透明度和统一规则仍是重点。
参考来源:
- https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/
- https://arcprize.org/arc-agi/3
- https://docs.arcprize.org/methodology
- https://arcprize.org/blog/arc-agi-3-gpt-5-5-opus-4-7-analysis
- https://huggingface.co/datasets/magic-sword/arc_agi_3_public_demo_human_testing
- https://tech.ifeng.com/c/8vB2CubQsk9









