GPT-6 Astra

## 产品简介 GPT-6 Astra 是 OpenAI 于 2026 年 9 月 3 日发布的最新旗舰 AI 模型

LLM大模型 部分免费

产品简介

GPT-6 Astra 是 OpenAI 于 2026 年 9 月 3 日发布的最新旗舰 AI 模型,被官方定义为"新一代智能"(A new generation of intelligence)。Astra 整合了 OpenAI 在预训练、强化学习与对齐方面的多年研究成果,在计算机操作、代码工程、网络安全、科学研究和专业工作等多个维度同时达到业界最高水平。

核心功能

一、桌面级 AI 智能体(Computer Use Agent)

GPT-6 Astra 的标志性能力是"桌面操作智能体"——它能够像人类一样操作电脑,在浏览器、桌面应用程序、文件系统之间自主导航并完成任务。它可以填写在线表单、更新 CRM 客户记录、整理日历、进行在线研究并在邮件或文档编辑器中起草摘要;可以在 Excel 中分析数据、生成图表、创建网站、运行前端 QA 检查;在 DaVinci Resolve 中完成调色工作;在 KiCad 中设计电路板;在 Blender 中构建 3D 场景;甚至被网友开发出"AI 导演"玩法,调用 Seedance 2.5 生成视频后自行剪辑导出,全程无需人工干预。

二、代码工程与软件开发

GPT-6 Astra 是迄今为止软件工程能力最强的模型。在 Codex 环境中,它引入了跨上下文窗口的记忆笔记功能——即使对话上下文窗口填满,之前的对话内容仍可被检索,避免了传统压缩摘要导致细节丢失的问题。它还支持在长会话中异步提问,不依赖用户回复即可继续不相关的工作。Benchmark 成绩:Terminal-Bench 4.0 得分 57.9%(Claude Opus 5 为 52.6%),DeepSWE v1.1 得分 74.1%,FrontierCode 1.1 Extended 得分 64.5%。

三、网络安全与漏洞发现

在网络安全领域,GPT-6 Astra 的 ExploitBench 得分为 100%(满分),远超 GPT-5.6 Sol 的 78.5%。在真实漏洞发现测试中,它在两周内独立发现了 Figma 全仓库中 100 多个此前未知的漏洞,其中包括 2 个 SAST 工具漏掉的严重级缺陷。它还发现了 2 个此前未知零日漏洞并主动通报给维护者。这使得"AI 安全代理"首次进入企业 SOC 团队的日常工具采购清单。

四、科学研究与数学推理

Astra 在 FrontierMath Tier 4 测试中取得 97.6% 的成绩(此前最高纪录为 90.2%),在 GPQA Diamond 测试中取得 96.0%,已帮助解决数学领域的长期开放问题。它还能直接在专业软件中处理实验数据、检查结果,辅助科研人员评估证据并决定下一步研究方向。

五、专业工作与文档生成

Astra 经过专门训练以适应专业环境,能生成结构清晰、布局专业的幻灯片、文档、电子表格和分析报告,严格遵循既有模板并匹配用户写作风格。在 AutomationBench 测试中得分 41.4%(Claude Fable 5.1 为 31.4%,GPT-5.6 Sol 为 18.1%)。

六、超长上下文与记忆能力

Astra 支持高达 100 万 token 的上下文窗口,在 OpenAI MRCR v2 的 8-needle 512K-1M 测试中取得 96.3% 准确率。更重要的是,它在 Codex 中支持跨会话记忆笔记(Cross-session Notes),积累的上下文信息不会因为窗口压缩而丢失,越用越聪明。

七、对齐与安全

在对齐测试中,面对不可能完成的任务,GPT-6 Astra 在 0% 的案例中超出授权范围行动(GPT-5.6 Sol 的这一数字为 48%)。它还内置了 CyberSBI 安全监控机制,在检测到高风险网络操作时会自动暂停并请求人工审核,确保安全能力不成为新的攻击面。

特色优势

极速高效:在 OSWorld 2.0 基准测试中,Astra 以约 47% 更少的时间完成任务(72.6% 得分 vs GPT-5.6 Sol 的 65.7%,任务耗时约 40 分钟 vs 75 分钟)。Robocurve 实测中,单次机械臂控制任务成本仅 0.94 美元(Claude Fable 5.1 为 2.12 美元),耗时 2.5 分钟(Fable 5.1 为 6.8 分钟),token 输出量减少 6.2 倍。

对齐优先:业界首次在真实安全运营中将"越界率"降至 0%,on-call 页面减少 20%,安全团队可以从"盯着告警"转向"维护先例库和裁决策略"。

多模态具身:Astra 不仅仅是大语言模型,已具备操控机械臂(Robocurve 实测 95% 成功率)、操作 Blender/DaVinci Resolve 等专业软件、指挥视频生成模型完成多模型协作流水线等具身能力。

超长记忆:在 Figma 安全运营场景中,通过"过去告警 + 行为指引 + 学到的库结构"三类记忆持续学习,4 周内将审查精确率从 15% 推到 80% 以上。99 行政策文档沉淀 68 条"先例",成为团队安全培训手册。

应用场景

一、企业安全运营中心(SOC):自动化告警分诊,将复杂告警解决时间缩短约 70%,on-call 页面减少 20%,Figma 已将其日常化部署在生产环境。

二、软件开发与代码审计:在 Figma 的全仓库审计中,4 周内发现 100 多个未知漏洞,PR 审查单次成本仅 0.50 美元,精确率从 15% 提升至 80% 以上。

三、AI 内容生产流水线:作为 AI 导演调用 Seedance 2.5 完成从故事脚本、3D 预演、视频渲染到桌面剪辑的全流程自动化,GPT-6、Fable、Gemini 三大模型轮流向 Seedance 2.5 派活。

四、科学研究辅助:结合科学推理与计算机操作能力,直接在专业软件中处理实验数据、生成图表,帮助研究人员评估证据、决定下一步研究方向。

五、具身智能与机器人控制:在双臂机械臂控制测试中,GPT-6 Astra 完成率 95%(Fable 5.1 为 40%),单次成本和耗时均不到竞品一半。

适用人群

安全工程师与 SOC 团队成员;软件开发者与 DevSecOps 工程师;数据科学家与科研人员;企业 IT 管理者与 AI 决策者;AI 研究人员与具身智能开发者。

出品方

OpenAI,总部位于美国旧金山。GPT-6 Astra 于 2026 年 9 月 3 日正式发布。

更新动态

  • 2026 年 9 月 3 日:GPT-6 Astra 正式发布,面向有限组织开放,后续逐步向 ChatGPT Plus、Pro、Enterprise 用户以及 API、Azure、Bedrock 用户推送。
  • 2026 年 9 月 5 日:Figma 工程博客发表长文,公布在生产环境中使用 Astra 进行安全运营的完整数据(告警提速 70%、发现 100+ 未知漏洞)。
  • 2026 年 9 月 4 日:Robocurve 实验室发布第三方机械臂控制评测报告,Astra 以 95% 完胜 Claude Fable 5.1。
  • 2026 年 8 月 10 日:Figma 发布第一篇 agent 安全博客,覆盖代码评审与全仓库审计。

官网链接

https://openai.com

团队信息

由 AI 猎手自动发现

评论与建议

0 条评论