GPT-6 Astra 来了,Greg 说欢迎来到 AGI 时代
OpenAI 今天发布 GPT-6 Astra,自称世界上最聪明、对齐最好的模型。
总裁 Greg Brockman 在发布前的媒体沟通会上说:他个人认为 OpenAI 已经做到了 AGI,未来回头看,可能就是这个模型。
先说大家最关心的问题:什么时候能用、多少钱。
首批只开放给 OpenAI 网络安全项目 Daybreak 的少数机构,未来几天陆续推送到 ChatGPT Plus、Pro、Business、Enterprise 用户,以及 API 和 AWS Bedrock。
用量包含在现有订阅额度里,用完可以买额外积分。
企业版默认关闭,需要管理员手动打开。
API 模型名 gpt-6-astra,每百万输入 Token 10 美元,输出 50 美元,和 Anthropic 的 Claude Fable 5.1 定价完全一样,是 GPT-5.6 Sol 促销价的 2.5 倍。
另有 Fast 模式,速度最高 2.5 倍,价格翻倍。
【1】主打的是替你操作电脑
Astra 这次最强调的能力是电脑操作(computer use),也就是模型自己控制屏幕、点鼠标、填表单、在真实软件里干活。Brockman 的原话是人在电脑上能做的,Astra 基本都能做。
OpenAI 给的场景很具体:填网页表单、更新 CRM 客户记录、整理日历、在邮件或文档编辑器里写研究摘要、分析科学数据并画图、建网站并跑前端测试、安装软件并排查屏幕上出现的报错。
速度是另一个重点。在 OSWorld 2.0 的延迟模拟里,Astra 完成一个任务约 40 分钟,得分 72.6%,GPT-5.6 Sol 要 75 分钟,得分 65.7%。
【2】编程:多数基准领先,但不是全面碾压
OpenAI 称 Astra 是迄今为止最好的软件工程模型。Terminal-Bench 4.0 得分 57.7%,Claude Fable 5.1 是 55.8%,GPT-5.6 Sol 只有 37.3%。
但看 OpenAI 自己贴的完整表格,情况没那么一边倒。
SWE-bench Verified 得分 76.3%,Claude Fable 5.1 是 78.5%,Astra 反而低了两个点。
Multi-SWE-bench 也是类似,Astra 54.5% vs Fable 5.1 的 57.9%。
也就是说在代码修复和多任务编码场景,Claude Fable 5.1 仍然有优势。
【3】多模态:图片理解很强,但视频和音频还没来
Astra 的图片理解能力大幅提升,在 MMMU-Pro 上得分 82.1%,比 Fable 5.1 的 79.4% 高出近 3 个百分点。
但 Astra 目前不支持视频和音频输入,这是个明显的短板。
【4】幻觉率:显著改善
Astra 的幻觉率是 1.3%,GPT-5.6 Sol 是 4.8%,Fable 5.1 是 2.0%。
这意味着 Astra 在事实准确性上确实有进步。
总结:Astra 在电脑操作和编程速度上有明显优势,但在代码修复和多任务编码上 Claude Fable 5.1 仍然更强。对于需要操作真实软件的场景,Astra 可能是目前最好的选择。对于纯编程任务,Claude Fable 5.1 仍然值得考虑。
这个对比对选择 AI 工具有参考价值。不同场景下,不同模型各有优势,关键是找到适合自己工作流的那个。
话题来源 @dotey
138K阅读 ❤️335 x.com/…↗ 已改写,非原文转载
23 浏览 0 评论
0 反应












