时间:2026 年 9 月 23 日 Epoch AI 公布测试结果,中文媒体于 9 月 26 日集中报道。
地点:美国旧金山 Epoch AI 实验室主导评测,覆盖全球主流多模态大模型。
人物:Epoch AI 团队、OpenAI GPT-6 Astra 开发团队、Anthropic Claude 系列团队、阿里 Qwen 与谷歌 Gemini 团队作为对照。
事件详情:Epoch AI 发布家具组装基准测试 FAB(Furniture Assembly Benchmark),用 60 张宜家家具组装过程照片(覆盖 STÄLL 鞋架、TONSTAD 床架、GULLABERG 八斗柜三款)评估多模态 AI 的视觉与空间推理能力。模型同时获得官方 PDF 说明书、图片放大工具与 Python 解释器,需在 80 步智能体沙盒内识别错误并定位出错步骤。
结果显示,OpenAI 最新多模态模型 GPT-6 Astra 以 80% 的准确率位居榜首,相比 2025 年 11 月时 Claude Opus 4.5 创下的 28% 纪录提升近三倍。Anthropic Claude Fable 5.1 与 Claude Opus 5 分别取得 70% 与 61%。GPT-6 Astra 完成单张照片分析的中位耗时约 3 分钟,是研究中最快模型,比此前领先模型快 2 至 10 倍,但仍不足以支撑实时识别。
研究还揭示了不同模型的典型错误倾向:谷歌 Gemini 与阿里 Qwen 系列几乎总是先假设存在错误再去找证据,Gemini 3.1 Pro 甚至几乎拒绝接受"无错误"结论;而早期 Anthropic 与 OpenAI 模型则相反,经常完全识别不出真实错误,GPT-5.4 在该项上漏检率最高。
背景:Epoch AI 设计 FAB 是为了填补现有视觉评测的盲区——主流图像描述、视觉问答、文档解析任务均不考察"对照说明书检查实物细节"的能力。该能力与汽车维修、家电检修、装配质检等需要结合图像与技术说明进行判断的工作高度相关,是 AI 进入车间与维修现场必须补齐的"课程"。
影响:FAB 的 10 个月从 28% 到 80% 跃升,是今年窄域视觉基准上最显著的能力跳升之一,证明多模态模型在细粒度视觉对比上正在快速逼近实用门槛。开源权重模型方面,表现最好的 Kimi K3 仍落后前沿约 7 个月,差距比综合能力评估中的 4.4 个月更大;DeepSeek V4 Pro、GLM 5.3 等热门模型则暂未提供图像支持。视觉推理正成为头部闭源模型进一步拉开领先优势的关键赛道。
总结:GPT-6 Astra 在 Epoch AI 家具组装基准 FAB 上以 80% 准确率刷新纪录,较 10 个月前提升近 3 倍,推理速度也领先其他模型 2 至 10 倍;尽管 3 分钟的单图延迟仍难支撑实时辅助,但视觉对比推理能力的快速跃迁,预示着 AI 在质检、维修与装配指导等实体场景的落地窗口正在打开。
参考来源:
- IT 之家:https://www.ithome.com/1/007/414.htm
- 腾讯新闻:https://news.qq.com/rain/a/20260926A08UMV00
- 新智元(Aiera):https://aiera.com.cn/asi-item.html?id=17e068c7
- The Decoder (via Wortins):https://www.wortins.com/story/openai-s-gpt-6-astra-can-now-tell-you-exactly-where-you-scre-64248416
- TPS Report:https://tpsreport.news/news/gpt-6-astra-furniture-assembly-benchmark-80-percent
- AlphaSignal:https://alphasignal.ai/news/epoch-s-fab-benchmark-watched-gpt-6-astra-jump-from-28-to-80
- Clawpit.io:https://www.clawpit.io/clawpit/1039/ai-learns-assemble-furniture-changing-game
- AI Daily Post:https://aidailypost.com/news/gpt-6-astra-scores-above-28







