热门AI工具推荐

焚书AI多模型聚合平台
AI多模型聚合平台( Claude 系列、GPT 系列)支持聊天、搜索、图片、视频、音乐等多种功能;聚合了 Claude 系列(如 Sonnet 5、Opus 5 等)、Gemini 系列、GPT 系列、DeepSeek(搜索模式默认调用 DeepSeek V4 Pro)以及通义千问、Kimi 等数十款国内外主流模型。
AI编程订阅服务,支持多款国产主流编程模型自由切换。
Seedance 2.0AI视频生成
具备卓越的物理真实性和角色一致性,可生成电影级视频内容。
方舟 Agent PlanAI智能体订阅
火山引擎推出的全场景AI智能体订阅服务,通过一个订阅整合5大主流模型和10+AI工具
SpeedAIAI内容检测降重
AI内容检测与降重工具,能有效帮助用户通过论文AI率检测
秒哒AI工具
不懂代码也能开发应用?百度秒哒:无需编程,快速搭建小程序与网站
有戏AIAI漫剧生成工具
全流程AI短剧创作工具,实现从剧本到成片的自动化生产,让“一人即剧组”成为现实。
沁言学术智能科研平台
一站式文献管理与科研写作工具,支持边写作边搜索文献,高效阅读,文献管理,

何恺明VISTA让Claude满分通关AGI考试

时间:2026年10月1日论文挂arXiv,10月4日中文媒体广泛报道并登上36氪、量子位、新智元等头条 地点:美国麻省理工学院(MIT)EECS系,CSAIL实验室 人物:MIT副教授、Google DeepMind兼职杰出科学家何恺明(Kaiming He);MIT博士生胡珂雅(Keya Hu)、韩秋实(Qiushi Han)、邱琳璐(Linlu Qiu);MIT副教授Cathy Wu;被测模型为Anthropic Claude Opus 5.0与OpenAI GPT-5.6 Sol 事件详情:何恺明团队10月1日在arXiv发表论文《VISTA: A Visual Harness for Reasoning in an Interactive World》(arXiv:2610.02200)。VISTA是一套"视觉Harness",给现成多模态大模型套上一双"真正的眼睛"和一本"无损相册":模型直接读取512×512的PNG原图(而不是ARC-AGI-3官方给的64×64数字网格),并把每一帧画面按编号存档,可随时调用inspect翻看、几帧并排比对、放大局部、用read_pixels读出精确颜色——翻相册不算步数,只有真在游戏里操作才计步。论文还配套两个笔记本GUIDE.md记游戏规则、WORKING.md当草稿纸。ARC-AGI-3是Keras之父François Chollet与ARC Prize基金会2026年3月发布的交互式像素小游戏AGI考卷,近500名人类小白作为基线,AI要通关且步数不超人类才能拿满分。VISTA加持下,Claude Opus 5.0的相对人类动作效率(RHAE)分数从裸跑40.68跳到100.00,打通25个公开游戏全部183关,总步数仅7302步,是首玩人类的0.43倍;GPT-5.6 Sol同样全部通关,拿99分;320B开源模型从裸跑1.89分暴涨到66.93分(35倍)。这套设计还在3D透视场景(84.12分)、34款网页游戏(成功率63.3%反超人类小白55.3%)、看图连线题等多个零样本环境验证有效。 背景:过去半年整个行业押注"模型做大+推理拉长"路线,Tycho、Schema等高分方案全靠让大模型给每个游戏写几千行Python硬造模拟器(Schema光是跳棋LF52就写了4000行)。何恺明团队的判断是"大模型的脑子早就够用了,卡住它的是眼睛和记性"——他们一年连发三篇论文死磕"ARC是视觉问题":第一篇VARC用1800万参数小模型从零训练纯看图追平人类平均分;第二篇NAT-ARC用ImageNet猫狗做预训练让抽象推理跟着变强;第三篇VISTA索性不训练小模型,直接给前沿大模型配上"相册"。VISTA刻意追求极简:没有新训练的模型,每个游戏的提示词是同一份四句话,没有一个字教它怎么玩——光这一招就在ARC-AGI-3做到了不写程序就满分,论文里称这是"第一个不靠写程序就在ARC-AGI-3上做到满分或近满分的系统"。 影响:VISTA把Claude从40分打到满分靠的却是"模型外面"的一双眼睛和一本相册,直接挑战整个行业的"大模型越大越聪明"默认路线。ARC Prize联合创始人Mike Knoop判断,越来越多的"学习"会发生在模型权重之外,通往AGI的下一程比的是谁能让模型看清世界、记住世界。何恺明团队的下一站是充满真实画面的具身环境——那里没人会提前把世界翻译成一张数字表;MIT CSAIL博士生胡珂雅(上海交大ACM班出身,三篇中两篇一作一篇二作)成为串起整个研究线的关键人物。 总结:何恺明MIT团队用VISTA"视觉Harness"证明,AGI瓶颈不在模型参数,而在感知与记忆——把数字网格换回图片、把上下文换成无损相册,Claude Opus 5.0就在ARC-AGI-3拿满分,步数只要人类0.43倍;这条"模型外部的眼睛+记忆"路线,可能比"再把模型做大"更接近通用智能。 参考来源: 1. https://arxiv.org/abs/2610.02200 — arXiv论文官方页(Qiushi Han*, Keya Hu*, Linlu Qiu, Cathy Wu, Kaiming He, 2026-10-01) 2. https://vista-research.github.io/ — VISTA项目官方博客(含全套数据与可视化) 3. https://www.alphaxiv.org/abs/2610.02200 — alphaXiv论文镜像与作者主页 4. https://m.sohu.com/a/1083883241_122014422 — 新智元/搜狐:Claude满分、GPT 99分!何恺明团队把AGI考试打穿了 5. https://finance.sina.cn/stock/jdts/2026-10-04/detail-initzrfm5584295.d.html — 新浪财经:Claude满分、GPT 99分!何恺明团队把AGI考试打穿了(10月4日 12:30) 6. https://www.kucoin.com/news/flash/he-kaiming-team-s-vista-system-achieves-100-100-in-agi-exam — KuCoin News英文全文转译 7. https://lillian039.github.io/ — 共同一作Keya Hu个人主页(含完整论文列表与教育背景) 8. https://people.csail.mit.edu/kaiming/ — 何恺明MIT官方主页(论文列表含VISTA) 9. https://36kr.com/p/4011070893871238 — 36氪:Claude满分、GPT 99分,何恺明团队把AGI考试打穿了 10. https://x.com/HuLillian39250/status/2085184679280521530 — Keya Hu X原帖:The first long-horizon visual harness to achieve a perfect 100% score on ARC-3 11. https://www.mindstudio.ai/blog/opus-5-arc-agi-3-breakthrough — MindStudio:How Claude Opus 5 Cracked ARC-AGI-3 With Algebraic Reasoning 12. https://arcprize.org/arc-agi/3 — ARC Prize官方:ARC-AGI-3交互式推理基准说明 13. https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents/ — NVIDIA开发者博客:另一条在ARC-AGI-3上做到100%的架构 14. https://arxiv.org/abs/2511.14761 — 何恺明团队前作:ARC Is a Vision Problem!(VARC基础论文)