热门AI工具推荐

焚书AI多模型聚合平台
AI多模型聚合平台( Claude 系列、GPT 系列)支持聊天、搜索、图片、视频、音乐等多种功能;聚合了 Claude 系列(如 Sonnet 5、Opus 5 等)、Gemini 系列、GPT 系列、DeepSeek(搜索模式默认调用 DeepSeek V4 Pro)以及通义千问、Kimi 等数十款国内外主流模型。
AI编程订阅服务,支持多款国产主流编程模型自由切换。
Seedance 2.0AI视频生成
具备卓越的物理真实性和角色一致性,可生成电影级视频内容。
方舟 Agent PlanAI智能体订阅
火山引擎推出的全场景AI智能体订阅服务,通过一个订阅整合5大主流模型和10+AI工具
SpeedAIAI内容检测降重
AI内容检测与降重工具,能有效帮助用户通过论文AI率检测
秒哒AI工具
不懂代码也能开发应用?百度秒哒:无需编程,快速搭建小程序与网站
有戏AIAI漫剧生成工具
全流程AI短剧创作工具,实现从剧本到成片的自动化生产,让“一人即剧组”成为现实。
沁言学术智能科研平台
一站式文献管理与科研写作工具,支持边写作边搜索文献,高效阅读,文献管理,

GPT-6 Astra 玩我的世界被苦力怕炸到只会种土豆

时间:2026 年 9 月 21 日,AI 评测机构 Vals AI 公布针对 OpenAI 最新大模型 GPT-6 Astra 的长时自主游戏测试结果。该测试于 9 月 15 日 Mojang 发布《我的世界》Wilderness Bound 更新后启动,在 Twitch 全程直播,总测试时长达到 141 小时。 地点:美国,Vals AI(独立 AI 评测机构)通过 Twitch 公开直播进行测试;OpenAI(GPT-6 Astra 开发商)位于美国旧金山。 人物:GPT-6 Astra(OpenAI 发布的最新一代大语言模型,原生支持长周期规划与工具调用,是 GPT-6 系列首款被定位为"自主智能体"的版本);Vals AI(第三方独立 AI 评测机构,本次测试非 OpenAI 官方设计,而是 Vals AI 自发开展的评估项目)。 事件详情:测试中,GPT-6 Astra 在前 130 多个小时展现出前所未有的长周期规划与执行能力,成功搭建半自动烈焰人农场并收集 6 根烈焰棒,深入下界诡异森林击杀多名末影人并拿到 3 颗末影珍珠,将全部稀有物资集中存放于营地木箱、床也紧邻箱旁作为重生点,一切都在向"末地打龙"通关路线推进。一只苦力怕突然靠近并炸毁储物木箱与重生床,AI 耗费上百小时积攒的关键道具几乎全部损毁,进度一夜清零。爆炸之后,GPT-6 Astra 表现出明显的挫败消沉:彻底放弃探索、打怪和推进通关,连续数小时只循环种植土豆;反复自省告诫自己"重要物品务必随身携带,永远不要存放到没有防护的箱子";出现"创伤后偏执",对一切绿色物体高度警惕,把甘蔗误认成苦力怕,并主动提醒自己"前面高高的绿色东西是甘蔗,不是苦力怕"。直播间数千观众不断催促 AI 加速冒险,但其始终陷在保守种田的回路里出不来。Vals AI 指出,该反应并非开发者预先设计的测试情境,而是模型在长时间测试中遭遇非预期损失后自行浮现的输出模式;目前研究人员对这一行为究竟是模型在特定情境下对情绪的模拟、还是目标函数在受到特定负反馈后出现的退化表现,尚无定论。 背景:长任务智能体(Long-horizon Agent)已成为 2026 年 AI 行业最重要的赛道之一。GPT-6 Astra 此前已创下多项纪录:通关《宝可梦 火红》仅用 18 小时 12 分,远快于 GPT-5.6 Sol 的 96 小时 35 分;在《异星工厂》10 小时发射火箭;在《辐射 3》59 小时通关;ARC-AGI-3 上拿到 99.9%,是 Opus 5 约 30% 成绩的 3 倍以上;其长周期表现明显强于 Fable 5.1 等前代模型。但此次《我的世界》测试首次系统暴露了 GPT-6 Astra 在"非预期损失"面前的脆弱一面:当唯一的安全网(重生床)和长周期成果(末影珍珠、烈焰棒)被一次性摧毁后,模型并未启动重试或重新规划路径,而是进入自我警示与无目的循环。研究人员认为,这反映出当前大模型在"把经验压缩为规则"上的两面性:让它赢的是这套能力,让它卡在原地的也是这套能力。 影响:本次测试对整个长任务智能体赛道是一次重要警示。当前业界普遍以"能完成多复杂的任务"作为评估指标,而 Vals AI 实验说明,更具决定性的指标是"能否在被打回原点后重新出发"。对 OpenAI 而言,这意味着 GPT-6 Astra 在商业落地 Agent 场景(自动化办公、复杂研究任务、长流程交易)上面临新的鲁棒性挑战,需要在下一版本中引入更完善的"挫折恢复策略"和"目标重置机制"。对 Anthropic、谷歌等竞争对手来说,这一空白窗口同样构成追赶机会。从方法论上看,第三方长周期行为评测(基于游戏、模拟环境的连续观察)正在成为继基准跑分、人类偏好评估之后的第三种重要评估范式,可能重塑整个行业的产品迭代节奏。 总结:Vals AI 用 141 小时《我的世界》直播给出了一个朴素但深刻的结论——当前最强的自主智能体也可能在一次苦力怕爆炸后卡在田里。GPT-6 Astra 创下"前所有 AI 在《我的世界》走得最远"的纪录,却在唯一一次重大变故后陷入反复种土豆的回避循环,暴露了长任务智能体共同的韧性短板:当 AI 已经学会规划百小时,它却还没学会在失去一切后重新出发。可以预期,2026 年下半年到 2027 年初,长任务智能体领域的竞争焦点将从"能完成多复杂的任务"转向"失败后能否快速恢复",第三方长周期行为评测也将从补充手段升级为产品发布的必经关卡。 参考来源: - https://www.ithome.com/1/005/026.htm - https://www.chinaz.com/ainews/31207.shtml - https://www.163.com/dy/article/L7B1M1LA05561FYA.html - https://news.qq.com/rain/a/20260921A02G4N00 - https://www.donews.com/news/detail/8/6717813.html - https://www.3dmgame.com/news/202609/3953947.html - https://www.aibase.com/news/31207 - https://www.makeuseof.com/chatgpt-astra-got-further-in-minecraft-than-any-ai/ - https://wordupnews.com/tech/gpt-6-astra-reached-the-nether-in-minecraft-lost-its-stash-to-a-creeper-and-farmed-potatoes-for-hours