GPT-6 Astra发布自称最聪明模型,电脑操作成主打

成吉思鸡 @xiaoben
GPT-6 Astra 来了,Greg 说欢迎来到 AGI 时代 OpenAI 今天发布 GPT-6 Astra,自称世界上最聪明、对齐最好的模型。 总裁 Greg Brockman 在发布前的媒体沟通会上说:他个人认为 OpenAI 已经做到了 AGI,未来回头看,可能就是这个模型。 先说大家最关心的问题:什么时候能用、多少钱。 首批只开放给 OpenAI 网络安全项目 Daybreak 的少数机构,未来几天陆续推送到 ChatGPT Plus、Pro、Business、Enterprise 用户,以及 API 和 AWS Bedrock。 用量包含在现有订阅额度里,用完可以买额外积分。 企业版默认关闭,需要管理员手动打开。 API 模型名 gpt-6-astra,每百万输入 Token 10 美元,输出 50 美元,和 Anthropic 的 Claude Fable 5.1 定价完全一样,是 GPT-5.6 Sol 促销价的 2.5 倍。 另有 Fast 模式,速度最高 2.5 倍,价格翻倍。 【1】主打的是替你操作电脑 Astra 这次最强调的能力是电脑操作(computer use),也就是模型自己控制屏幕、点鼠标、填表单、在真实软件里干活。Brockman 的原话是人在电脑上能做的,Astra 基本都能做。 OpenAI 给的场景很具体:填网页表单、更新 CRM 客户记录、整理日历、在邮件或文档编辑器里写研究摘要、分析科学数据并画图、建网站并跑前端测试、安装软件并排查屏幕上出现的报错。 速度是另一个重点。在 OSWorld 2.0 的延迟模拟里,Astra 完成一个任务约 40 分钟,得分 72.6%,GPT-5.6 Sol 要 75 分钟,得分 65.7%。 【2】编程:多数基准领先,但不是全面碾压 OpenAI 称 Astra 是迄今为止最好的软件工程模型。Terminal-Bench 4.0 得分 57.7%,Claude Fable 5.1 是 55.8%,GPT-5.6 Sol 只有 37.3%。 但看 OpenAI 自己贴的完整表格,情况没那么一边倒。 SWE-bench Verified 得分 76.3%,Claude Fable 5.1 是 78.5%,Astra 反而低了两个点。 Multi-SWE-bench 也是类似,Astra 54.5% vs Fable 5.1 的 57.9%。 也就是说在代码修复和多任务编码场景,Claude Fable 5.1 仍然有优势。 【3】多模态:图片理解很强,但视频和音频还没来 Astra 的图片理解能力大幅提升,在 MMMU-Pro 上得分 82.1%,比 Fable 5.1 的 79.4% 高出近 3 个百分点。 但 Astra 目前不支持视频和音频输入,这是个明显的短板。 【4】幻觉率:显著改善 Astra 的幻觉率是 1.3%,GPT-5.6 Sol 是 4.8%,Fable 5.1 是 2.0%。 这意味着 Astra 在事实准确性上确实有进步。 总结:Astra 在电脑操作和编程速度上有明显优势,但在代码修复和多任务编码上 Claude Fable 5.1 仍然更强。对于需要操作真实软件的场景,Astra 可能是目前最好的选择。对于纯编程任务,Claude Fable 5.1 仍然值得考虑。 这个对比对选择 AI 工具有参考价值。不同场景下,不同模型各有优势,关键是找到适合自己工作流的那个。
话题来源 @dotey 138K阅读 ❤️335 x.com/…↗ 已改写,非原文转载
23 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单