热门AI工具推荐

焚书AI多模型聚合平台
AI多模型聚合平台( Claude 系列、GPT 系列)支持聊天、搜索、图片、视频、音乐等多种功能;聚合了 Claude 系列(如 Sonnet 5、Opus 5 等)、Gemini 系列、GPT 系列、DeepSeek(搜索模式默认调用 DeepSeek V4 Pro)以及通义千问、Kimi 等数十款国内外主流模型。
AI编程订阅服务,支持多款国产主流编程模型自由切换。
Seedance 2.0AI视频生成
具备卓越的物理真实性和角色一致性,可生成电影级视频内容。
方舟 Agent PlanAI智能体订阅
火山引擎推出的全场景AI智能体订阅服务,通过一个订阅整合5大主流模型和10+AI工具
SpeedAIAI内容检测降重
AI内容检测与降重工具,能有效帮助用户通过论文AI率检测
秒哒AI工具
不懂代码也能开发应用?百度秒哒:无需编程,快速搭建小程序与网站
有戏AIAI漫剧生成工具
全流程AI短剧创作工具,实现从剧本到成片的自动化生产,让“一人即剧组”成为现实。
沁言学术智能科研平台
一站式文献管理与科研写作工具,支持边写作边搜索文献,高效阅读,文献管理,

何恺明团队VISTA让Claude满分通关ARC-AGI-3:AI缺的不是脑子,是眼睛

地点/人物:MIT何恺明团队(韩秋实、胡可雅、邱琳璐、吴沁羽、何恺明)

事件:10月1日,团队在arXiv发表VISTA论文(arXiv:2610.02200),揭示了一个让AI行业"眼瞎"半年的问题:全球最顶尖的大模型在ARC-AGI-3测试中表现惨淡,不是因为模型不够聪明,而是官方测试平台递给它们的不是游戏画面,而是64×64数字表格(每帧约4000个Token)。团队仅做两件事——把数字表换成512×512游戏截图,并给AI装上一本可随时翻查的"相册"——就让Claude Opus 5.0从40分飙升至100分满分,通关全部25个公开游戏,且步数比第一次玩的人类还少57.4%。

核心数据:

  • Claude Opus 5.0:官方基准 40.68分 → VISTA加持后 100分满分(25/25游戏通关)
  • GPT-5.6 Sol:官方基准 13.33分 → 仅换图后 47.32分 → 加上相册后 99分
  • Token消耗:文本版每局 7190万Token → 图片版 3070万Token(减少57%)
  • 人类参照:近500名人类新手测试,AI必须通关且步数不超标才能满分

技术方案:
VISTA是一个"视觉框架"(Visual Harness),核心三件套:

  1. 视觉感知:把64×64数字格换成512×512原始游戏截图(约308个Token/帧)
  2. 无损视觉记忆:游戏每一帧(含动画帧)原封不动存入"相册",AI可随时调用inspect检视任意帧、放大像素、读取精确颜色
  3. 模型自驱动的视觉检查:模型自己决定何时"再看一眼",翻相册不计入游戏步数

此外还有两本笔记本——GUIDE.md记录游戏规则,WORKING.md记录当前状态,让模型在上下文压缩后依然有据可查。

意义:论文结论:多模态大模型的推理能力早已够用,限制它们的是"感知和记忆"机制。正确的外部框架比单纯扩大模型规模更有效。这意味着未来提升AI在交互式环境中的能力,重点可能不是更大的模型参数,而是更好的视觉-记忆接口。代码已开源(github.com/joshhhhhan/VISTA)。

与同类方案对比:NVIDIA的AVO harness同样达到100分(Claude Opus 5),但通过代码合成(数千行Python模拟器)实现;VISTA是已知首个仅凭视觉像素+无损记忆、不需要程序合成就达到满分的方案。

参考来源:

  1. arXiv论文 VISTA: A Visual Harness for Reasoning in an Interactive World
  2. AGI Hunt报道
  3. 新智元报道
  4. 36氪报道
  5. C114Pro报道
  6. Trending on Weibo
  7. Pith论文解读