热门AI工具推荐

AI编程订阅服务,支持多款国产主流编程模型自由切换。
Seedance 2.0AI视频生成
具备卓越的物理真实性和角色一致性,可生成电影级视频内容。
方舟 Agent PlanAI智能体订阅
火山引擎推出的全场景AI智能体订阅服务,通过一个订阅整合5大主流模型和10+AI工具
StepClaw阶跃AI桌面伙伴龙虾Agent智能体
StepClaw是阶跃星辰推出的本地和云端的AI龙虾助手,通过一键部署让普通用户也能拥有7×24小时在线、可自主执行任务的AI数字工作伙伴。
基于OpenClaw架构打造的AI助手平台,核心优势包括云端一键部署、沙箱隔离安全运行、全面接入企业微信/钉钉/飞书三大主流IM工具
SpeedAIAI内容检测降重
AI内容检测与降重工具,能有效帮助用户通过论文AI率检测
墨刀AIAI原型设计平台
墨刀AI是一款能通过一句话描述或图片,快速生成可交互原型、PRD文档及各类图表的一站式智能产品设计协作平台。
秒哒AI工具
不懂代码也能开发应用?百度秒哒:无需编程,快速搭建小程序与网站
有戏AIAI漫剧生成工具
全流程AI短剧创作工具,实现从剧本到成片的自动化生产,让“一人即剧组”成为现实。
沁言学术智能科研平台
一站式文献管理与科研写作工具,支持边写作边搜索文献,高效阅读,文献管理,

月之暗面开源视觉基准 大模型无一及格

时间:2026 年 8 月 15 日(The Decoder 报道,月之暗面 7 月 28 日发布) 地点:中国 / 全球开源社区 人物:月之暗面 Kimi 团队(Moonshot AI);Kimi K3 模型团队;GPT-5.6 Sol、Claude Fable 5、Gemini 3.1 Pro 等 16 款前沿多模态大模型团队 事件详情: 月之暗面(Moonshot AI)正式开源 PerceptionBench——一个聚焦"原子级视觉感知"的多模态大模型评测基准。与传统将感知、知识、推理混在一起的评测方式不同,PerceptionBench 把视觉能力拆解为 10 个原子子技能:Visual Relation、Counting、Attributes、Depth & 3D、Localization、Comparison、Fine-grained Recognition、Context Integration、OCR、Hallucination。 数据集规模:研究团队从内部 17,000+ 经过人工验证的题目中精选 3,000 道对外发布——60% 来自 42 个现有评测集中的可归属模型失败案例,40% 来自新构造的增强图像题。题目设计原则是"看一眼就能答",剥离推理与外部知识干扰。 关键评测结果(16 款前沿多模态大模型): - 整体准确率第一名:GPT-5.6 Sol(59.7%)——全行业无一模型突破 60%; - Kimi K3:58.5%(第二); - Claude Fable 5:57.2%; - Gemini 3.1 Pro:56.2%; - GPT-5.5:55.8%; - 开源代表:Qwen3.5-397B-A17B 47.5%、GLM-4.6V 32.5% 显著落后; - 最弱子能力:Hallucination(幻觉);GPT-5.6 Sol 在该项目只有 26.9%,但 Gemini 3.5 Flash 反以 50.6% 领先——综合分相近的模型在不同子项上的表现可以差异极大。 核心洞察:作者明确指出,多模态大模型在多步任务上"看似推理错误",其实多数在"读图阶段"就已经出错。PerceptionBench 通过把多步任务拆解为纯感知子问题,让"模型到底哪里看不到"变得可定位。 背景: - 月之暗面此前已发布 WorldVQA:把物体识别与推理分开测,最强的 Gemini 3 Pro 也只拿到 47.4%,且所有模型系统性高估自己的置信度; - 与中国机构合作的 BabyVision 基准:模拟幼儿视觉任务(描线、数隐藏积木),Gemini 3 Pro 49.7%,人类 94.1%——研究指出存在"语言化瓶颈",即视觉信息翻译成语言时会丢失细节; - 行业背景:随着 GPT-5、Claude Fable 5、Gemini 3.5 等模型陆续发布,"多模态跑分越来越漂亮"已不能掩盖"基础视觉感知仍不扎实"的事实;Kimi、智谱、阿里等中国厂商借此类基础基准争夺评测话语权。 影响: 1. 多模态竞争焦点下移:从"会看图"转向"看得准"——基础视觉能力将成下一轮模型升级重点; 2. 开源评测话语权提升:月之暗面、智谱等中国团队通过 BabyVision、PerceptionBench、WorldVQA 等基准在国际评测体系获得更大影响力; 3. 自动驾驶 / 机器人落地风险提示:视觉感知是具身智能、自动驾驶的关键模块,"不及格"意味着这些场景仍需谨慎; 4. 推动行业反思"verbalization bottleneck":研究者认为"图像→语言→理解"的链路上信息损失严重,可能催生新一代原生多模态架构(如原生分辨率 + 长思考)。 总结: 3,000 道题、10 个原子能力、16 款前沿模型——月之暗面 PerceptionBench 用"剥离推理、只测视觉"的方式,撕开了多模态大模型"看似很强、其实连图都看不清楚"的真相。GPT-5.6 Sol 仍卡在 59.7%,没有模型跨过及格线。这份开源基准将成未来一年多模态模型迭代的关键指挥棒。 参考来源: 1. The Decoder(深度分析):https://the-decoder.com/new-benchmark-confirms-ai-models-still-perform-poorly-at-visual-perception/ 2. 月之暗面 Kimi 官方博客:https://www.kimi.com/blog/perception-bench 3. GitHub 数据集与评测代码:https://github.com/MoonshotAI/PerceptionBench 4. 腾讯科技(PerceptionBench 准确率榜首 GPT-5.6 Sol):https://so.html5.qq.com/page/real/search_news?docid=70000021_9746a68d49070952 5. The Decoder(WorldVQA 评测):https://the-decoder.com/when-ai-models-cant-see-they-just-make-something-up/ 6. The Decoder(BabyVision 视觉幼儿任务):https://the-decoder.com/even-the-best-ai-models-fail-at-visual-tasks-toddlers-handle-easily/ 7. 月之暗面官方主页(K3 + PerceptionBench):http://www.moonshot.cn/