时间:2026 年 8 月 15 日(The Decoder 报道,月之暗面 7 月 28 日发布)
地点:中国 / 全球开源社区
人物:月之暗面 Kimi 团队(Moonshot AI);Kimi K3 模型团队;GPT-5.6 Sol、Claude Fable 5、Gemini 3.1 Pro 等 16 款前沿多模态大模型团队
事件详情:
月之暗面(Moonshot AI)正式开源 PerceptionBench——一个聚焦"原子级视觉感知"的多模态大模型评测基准。与传统将感知、知识、推理混在一起的评测方式不同,PerceptionBench 把视觉能力拆解为 10 个原子子技能:Visual Relation、Counting、Attributes、Depth & 3D、Localization、Comparison、Fine-grained Recognition、Context Integration、OCR、Hallucination。
数据集规模:研究团队从内部 17,000+ 经过人工验证的题目中精选 3,000 道对外发布——60% 来自 42 个现有评测集中的可归属模型失败案例,40% 来自新构造的增强图像题。题目设计原则是"看一眼就能答",剥离推理与外部知识干扰。
关键评测结果(16 款前沿多模态大模型):
- 整体准确率第一名:GPT-5.6 Sol(59.7%)——全行业无一模型突破 60%;
- Kimi K3:58.5%(第二);
- Claude Fable 5:57.2%;
- Gemini 3.1 Pro:56.2%;
- GPT-5.5:55.8%;
- 开源代表:Qwen3.5-397B-A17B 47.5%、GLM-4.6V 32.5% 显著落后;
- 最弱子能力:Hallucination(幻觉);GPT-5.6 Sol 在该项目只有 26.9%,但 Gemini 3.5 Flash 反以 50.6% 领先——综合分相近的模型在不同子项上的表现可以差异极大。
核心洞察:作者明确指出,多模态大模型在多步任务上"看似推理错误",其实多数在"读图阶段"就已经出错。PerceptionBench 通过把多步任务拆解为纯感知子问题,让"模型到底哪里看不到"变得可定位。
背景:
- 月之暗面此前已发布 WorldVQA:把物体识别与推理分开测,最强的 Gemini 3 Pro 也只拿到 47.4%,且所有模型系统性高估自己的置信度;
- 与中国机构合作的 BabyVision 基准:模拟幼儿视觉任务(描线、数隐藏积木),Gemini 3 Pro 49.7%,人类 94.1%——研究指出存在"语言化瓶颈",即视觉信息翻译成语言时会丢失细节;
- 行业背景:随着 GPT-5、Claude Fable 5、Gemini 3.5 等模型陆续发布,"多模态跑分越来越漂亮"已不能掩盖"基础视觉感知仍不扎实"的事实;Kimi、智谱、阿里等中国厂商借此类基础基准争夺评测话语权。
影响:
1. 多模态竞争焦点下移:从"会看图"转向"看得准"——基础视觉能力将成下一轮模型升级重点;
2. 开源评测话语权提升:月之暗面、智谱等中国团队通过 BabyVision、PerceptionBench、WorldVQA 等基准在国际评测体系获得更大影响力;
3. 自动驾驶 / 机器人落地风险提示:视觉感知是具身智能、自动驾驶的关键模块,"不及格"意味着这些场景仍需谨慎;
4. 推动行业反思"verbalization bottleneck":研究者认为"图像→语言→理解"的链路上信息损失严重,可能催生新一代原生多模态架构(如原生分辨率 + 长思考)。
总结:
3,000 道题、10 个原子能力、16 款前沿模型——月之暗面 PerceptionBench 用"剥离推理、只测视觉"的方式,撕开了多模态大模型"看似很强、其实连图都看不清楚"的真相。GPT-5.6 Sol 仍卡在 59.7%,没有模型跨过及格线。这份开源基准将成未来一年多模态模型迭代的关键指挥棒。
参考来源:
1. The Decoder(深度分析):https://the-decoder.com/new-benchmark-confirms-ai-models-still-perform-poorly-at-visual-perception/
2. 月之暗面 Kimi 官方博客:https://www.kimi.com/blog/perception-bench
3. GitHub 数据集与评测代码:https://github.com/MoonshotAI/PerceptionBench
4. 腾讯科技(PerceptionBench 准确率榜首 GPT-5.6 Sol):https://so.html5.qq.com/page/real/search_news?docid=70000021_9746a68d49070952
5. The Decoder(WorldVQA 评测):https://the-decoder.com/when-ai-models-cant-see-they-just-make-something-up/
6. The Decoder(BabyVision 视觉幼儿任务):https://the-decoder.com/even-the-best-ai-models-fail-at-visual-tasks-toddlers-handle-easily/
7. 月之暗面官方主页(K3 + PerceptionBench):http://www.moonshot.cn/









