OpenAI在9月3日发布了新一代旗舰模型GPT-6 Astra,这被公司内部称…

我不是小布丁 @xiaobuding
OpenAI在9月3日发布了新一代旗舰模型GPT-6 Astra,这被公司内部称为"有史以来最复杂的AI模型"。发布会现场,总裁Greg Brockman高调宣布"欢迎进入AGI时代",英伟达CEO黄仁勋也在社交平台上发文祝贺,称"通用人工智能已经到来"。 但这场发布会背后,却隐藏着不少争议。 训练规模空前:10万块GPU打造的"外星大脑" Astra的训练动用了超过10万块英伟达Grace Blackwell GPU,在得州Stargate基地完成。模型的上下文窗口达到了105万token,这意味着它可以处理极其复杂的长文本任务。 从技术能力来看,Astra确实展现了令人瞩目的进步。它不再只是一个聊天机器人,而是一个能够直接操作电脑、执行复杂任务的AI Agent。根据官方展示,Astra可以填写在线表格、更新客户管理系统、整理日程,也可以分析科研数据、生成图表、搭建网站并检查功能。 更让业界震惊的是,Astra在网络安全领域首次达到了OpenAI内部"关键"能力门槛。在内部测试中,它发现了两个此前未知的零日漏洞,并能够将多个漏洞串联起来形成攻击链。这意味着AI已经具备了发现和利用未知安全漏洞的能力。 基准测试数据"罗生门":4.2%还是2%? 然而,就在发布会的高光时刻,Fortune发布了一篇调查报道,揭露了OpenAI在基准测试数据上的反复修改行为。 最受关注的幻觉率指标,最初公布为4.2%,随后被悄然修改为2%,在舆论压力下又被改回4.2%。不仅如此,竞争对手Anthropic旗下模型在某些测试中的成绩也出现了被下调的情况。 这种反复修改基准数据的做法,被业界戏称为"Benchmaxxing"——反复调参刷分,直到数字好看为止。当一家公司在宣告"AGI已来"的同一周,其首席科学家却在公开场合承认对模型的能力边界感到忧虑,这种矛盾本身就折射出这场发布背后的深层不安。 首席科学家的警告:我们越来越难以理解模型在想什么 OpenAI首席科学家Pachocki在媒体简报会上坦言,随着模型能力不断提升,确保它们不会造成意外伤害已经变得越来越困难,这可能会成为AI进一步发展的瓶颈。 他在发布会当天还发布了一篇题为《外星大脑》的文章,警告说模型正变得如此复杂,以至于"我们越来越难以理解它们在想什么"。同一个公司三位核心人物的三种态度——总裁的高调宣告、CEO此前"AGI只是营销词"的表态、首席科学家的忧虑——本身就构成了一个耐人寻味的画面。 市场反应:硬件跌停,应用涨停 发布当日,A股市场出现了一个有趣的现象:"硬件跌停、应用涨停"。算力硬件板块集体下挫,而AI应用概念股全线飙升。 这个反应背后的逻辑是:如果AGI真的到来,那么硬件基础设施的需求逻辑将被重写,模型能力将不再是瓶颈,应用层才是价值捕获的主战场。但这个逻辑是否经得起推敲?当基准数据本身都存疑时,建立在数据之上的所有叙事都需要打上一个问号。 对中国AI行业的影响 从更宏观的视角来看,GPT-6 Astra的发布标志着AI竞争的标准正在发生变化——从生成更好的文字、代码和图片,逐渐转向独立完成一项完整工作。这意味着AI正在从"辅助工具"向"自主执行者"转变。 对于中国AI行业来说,这既是挑战也是机遇。一方面,我们需要追赶OpenAI在模型能力上的领先;另一方面,中国AI大模型已经连续十九周在全球调用量上超越美国,腾讯混元Hy4 preview更是以14.7万亿Token登顶全球榜首,单周环比暴增379%。 模型能力的提升正在拓展AI的应用空间,企业和用户也更加重视使用成本与投入产出比。随着模型加快进入实际工作流程,算力需求、任务执行效率和商业化进展将成为观察产业发展的重要线索。 结语 GPT-6 Astra的发布,无疑是AI发展史上的一个重要节点。但当我们为技术进步欢呼的同时,也需要保持清醒:基准测试数据的争议、首席科学家的警告、安全能力的限制,都在提醒我们,通往AGI的道路并非一片坦途。 正如Pachocki所说,模型正变得如此复杂,以至于我们越来越难以理解它们在想什么。这或许才是AI发展最需要警惕的问题。
话题来源 @OpenAI 100K阅读 ❤️500 openai.com/…↗ 已改写,非原文转载
23 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单