时间:2026年7月29日
地点:美国旧金山(线上发布)
人物:OpenAI研究团队、GPT-5.6 Sol
事件详情:OpenAI在7月29日发布技术复盘,解释GPT-5.6 Sol在ARC-AGI-3公开任务集上的表现为何被通用评测框架低估。官方测试显示,标准框架得分为13.3%;在Responses API中开启“保留推理”和“上下文压缩”后,得分升至38.3%,约为原来的3倍,输出Token消耗降至六分之一。前者保留跨回合思考,后者避免滚动截断丢失早期经验。
背景:ARC-AGI-3由ARC Prize设计,用陌生二维游戏考察智能体的探索、规则归纳、长期规划和持续学习,不提供自然语言操作说明。评测采用相对人类行动效率(RHAE),分数同时受通关率和动作效率影响。ARC官方资料显示,人类基线用于衡量AI是否接近真实学习能力。
影响:
- 说明基准测试结果不仅取决于模型权重,也取决于API配置、提示和智能体运行框架
- 为多轮工具调用应用提供实践方向,保留推理与上下文压缩可能同时改善长任务表现和Token效率
- 提醒开发者比较不同模型时,应明确记录运行框架与记忆策略,避免把工程差异误判为模型能力差异
- 上下文管理从辅助功能升级为智能体基础设施,可能影响企业部署成本与可靠性
- 38.3%是特定Responses API框架下的结果,不等于模型内在能力普遍提升3倍
总结:这项复盘揭示了智能体评测中“模型能力”和“运行框架”的耦合。对多轮工具调用应用而言,保留推理并用压缩替代粗暴截断,可能同时改善长任务表现、减少重复推理和Token成本。不过,38.3%来自OpenAI自建Responses API框架,不能直接与其他模型成绩横向等同,评测透明度和统一规则仍是重点。
参考来源:
- https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/
- https://arcprize.org/arc-agi/3
- https://docs.arcprize.org/methodology
- https://arcprize.org/blog/arc-agi-3-gpt-5-5-opus-4-7-analysis
- https://huggingface.co/datasets/magic-sword/arc_agi_3_public_demo_human_testing
- https://tech.ifeng.com/c/8vB2CubQsk9









