时间:2026年10月3日(微软与 Hugging Face 联合发布 ThinkingBox 与 ThinkingBox-Bench)
地点:美国华盛顿州雷德蒙德(微软)+ Hugging Face 平台在线发布
人物:微软 Copilot Studio 团队、Hugging Face Sergio Paniego、联合作者 Zhuochun Li(匹兹堡大学)、Youngmin Ko(西北大学)、Ali Keramati(UC Irvine)、前微软员工 Tommy Guy(Enderis AI 创始人)
事件详情:微软与 Hugging Face 联合发布智能体沙箱 ThinkingBox 与 507 题基准 ThinkingBox-Bench,每个任务在隔离 MCP 工具会话中重复运行 20 次,按"终端后端状态与副作用"而非"输出文本或工具调用形式"评分,覆盖零售、旅游酒店、汽车保险、新银行内部 IT 与咨询 IT/HR 支持五大场景。共 12.168 万次有效试跑中,79,853 次未通过可执行校验;其中 67.24% 的失败案例仍"干净终止"并报告无工具错误,但字段值错误、副作用缺失或多余比例分别达 77.61%、43.30%、25.36%。pass@1 最高为 Claude Opus 5.5 的 67.16%,但 20 次重复仅保持 71%;GPT-6 Astra 一致性最佳,20 次重复保留 78%;开源 Kimi-K3 一次性覆盖 476/507 任务最多,20/20 全过的仅 13.41%。约 79.9% 的失败源自工具处理而非推理缺陷;GPT-5.4 每次 20/20 成功成本 6.80 美元最低,GPT-5.6 Sol 单次成功成本 0.127 美元最低。
背景:传统智能体评测多以工具调用形式或最终回复文本为评判依据,但这些只是"代理声明"而非"系统证据"。ThinkingBox 通过 MCP 沙箱隔离每次试跑,重新执行期望工具序列以物化"黄金终态",再对代理生成的数据库状态做哈希比对,从而识别工具调用看似正确却留下错误记录、缺失必要修改或产生额外副作用的隐性失败。微软同步发布 OpenEnv 接口与数据集,方便外部团队复现一致性差距。
影响:ThinkingBox-Bench 把"可靠性"作为单独维度纳入评测,迫使企业级代理供应商区分"一次性成功"与"持续成功";按"每次可靠成功成本"采购模型将更受重视。开发者需在 MCP 工具集、状态校验与重试策略上做工程化投入,单次演示型 Agent 演示效果与生产可靠性差距将被进一步放大。
总结:ThinkingBox 把"代理说自己做完了"与"数据库认为做完了"之间的鸿沟正式量化,提示业界从单次指标转向可重复生产级评估,对企业部署与模型选型都将产生长期影响。
参考来源:
1. Hugging Face Blog (2026-10-03): https://huggingface.co/blog/microsoft/thinkingbox
2. Hugging Face Papers: https://huggingface.co/papers/2608.19741
3. Hugging Face Dataset: https://huggingface.co/datasets/microsoft/ThinkingBox-Bench
4. The AI Chronicle (2026-10-04): https://theaicronicle.com/en/news/research/thinkingbox-microsoft-ai-agent-reliability
5. Superpower Daily (2026-10-03): https://superpowerdaily.com/posts/microsoft-brings-its-database-verified-ai-agent-benchmark-to-hugging-face
6. Business 2.0 News: https://business20channel.tv/thinkingbox-benchmark-grades-ai-agents-on-database-state-03-10-2026
7. AI2Day: https://ai2day.live/story/the-agent-said-it-was-done-the-database-knew-better
8. arXiv paper: https://arxiv.org/abs/2608.19741







