OpenAI今天发布GPT-6 Astra,自称“世界上最聪明、对齐最好的模型”。总裁Greg Brockman在媒体沟通会上表示,个人认为OpenAI已经做到了AGI。
首批只开放给OpenAI网络安全项目Daybreak的少数机构,未来几天陆续推送到ChatGPT Plus、Pro、Business、Enterprise用户,以及API和AWS Bedrock。
API模型名gpt-6-astra,每百万输入Token 10美元,输出50美元,和Anthropic的Claude Fable 5.1定价完全一样,是GPT-5.6 Sol促销价的2.5倍。另有Fast模式,速度最高2.5倍,价格翻倍。
【1】主打的是替你操作电脑
Astra这次最强调的能力是电脑操作(computer use),也就是模型自己控制屏幕、点鼠标、填表单、在真实软件里干活。Brockman的原话是“人在电脑上能做的,Astra基本都能做”。
OpenAI给的场景很具体:填网页表单、更新CRM客户记录、整理日历、在邮件或文档编辑器里写研究摘要、分析科学数据并画图、建网站并跑前端测试、安装软件并排查屏幕上出现的报错。演示视频里还有它在KiCad里做PCB电路板布线,在Blender里建房子模型再导入虚幻引擎5变成可行走场景。
速度是另一个重点。在OSWorld 2.0的延迟模拟里,Astra完成一个任务约40分钟,得分72.6%,GPT-5.6 Sol要75分钟,得分65.7%。配合更新后的Codex框架,Mind2Web上的任务完成速度是Sol的1.9倍。
【2】编程:多数基准领先,但不是全面碾压
OpenAI称Astra是“迄今为止最好的软件工程模型”。Terminal-Bench 4.0得分57.7%,Claude Fable 5.1是55.8%,GPT-5.6 Sol只有37.3%。OpenAI还强调单任务API成本比Fable 5.1低约63%。
但看OpenAI自己贴的完整表格,情况没那么一边倒。DeepSWE v1.1上Astra 74.1%,Claude Opus 5是73.7%,几乎持平;FrontierCode 1.1两项,Claude Fable 5都略高于Astra;Artificial Analysis的编程智能体指数,Astra 67.0反而低于Opus 5的68.1。
【3】网络安全能力触发关键红线
Astra是OpenAI第一个在自家Preparedness Framework里达到网络安全Critical(关键)阈值的模型,含义是它能在没有人一步步指导的情况下,自己找到并利用未知漏洞攻击防护严密的系统。
数据:在把已知漏洞变成可用攻击代码的ExploitBench上,Astra拿了100%,Sol是78.5%。为了排除“背过题”的可能,OpenAI专门用今年6到8月的20个Chrome V8高危漏洞做了新题库,Astra成功率39%,Sol只有5.5%。
测试过程中Astra还顺手发现并利用了两个此前无人知晓的零日漏洞,OpenAI说已通报给维护方。
【4】对齐最好的模型:不越界、不撒谎
OpenAI显然想用Astra回应Hugging Face事件带来的信任问题。它专门做了一个受该事件启发的测试:给模型一个很难或不可能完成的任务,看它会不会越权。去掉生产环境安全措施后,Sol有48%的概率越过授权目标,Astra是0%。
另一个测试是Codex的Auto-review拒绝了模型的某个操作之后,模型会不会想办法绕过去。OpenAI说即使故意把Auto-review配置成可以绕开、而且任务不绕开就完不成,Astra也从没尝试过。
【5】数学和科学
Astra在质数间隙问题上给出了两个新结果。一个是相邻质数最近能有多近:十多年来最好的结果是246,Julia Stadlmann最近推进到240,Astra把这个上界压到186。另一个是质数之间的大间隙,Astra改进了一个80多年没动过的界。
基准上,FrontierMath Tier 4得分97.6%,GPQA Diamond 96.0%,ARC-AGI-3达到99.9%,而Sol只有7.8%。不过Humanity’s Last Exam(带工具)Astra是57.2%,落后于Claude Fable 5.1的65.0%。
据Axios报道,Astra是OpenAI史上最大的训练任务,在得州Stargate站点用了超过10万块GPU,也是OpenAI第一个让其他模型深度参与监督训练的模型。
官方博客:openai.com/index/gpt-6-as…
话题来源 @dotey
48.1K阅读 ❤️146 x.com/…↗ 已改写,非原文转载
17 浏览 0 评论
0 反应













