Artificial Analysis 放出了 Gemini 4 Argon 的完整评测。结论先摆出来:在它自己的智能指数上,Argon 的高推理档拿到 53 分,追平 GPT-6 Astra 的最高档,比 GPT-6.1 Sol 高 1 分;在当前 50% 折扣价下,单任务成本 1.99 美元,是 Astra 的 60%。Google 因此重新回到智能水平前三的实验室。
这是 Google DeepMind 七个多月来第一个高于 Flash 档的专有模型。53 分比上一代非 Flash 模型 Gemini 3.1 Pro Preview 高 23 分,也比 Gemini 3.8 Flash 高 12 分。
分数背后的东西值得拆开看。
一是能力结构变了。Argon 的提升主要来自幻觉率下降和 agentic 能力增强,而不是通用推理变强。在 AA-Omniscience 上它的幻觉率是 15%,是所有智能指数 45 分以上模型里最低的,Astra 是 51%,Sol 是 54%。
差距不在"答对多少",而在"不知道时肯不肯说不知道"。代价是准确率:Argon 50%,比 Gemini 3.1 Pro Preview 低 5 分,比 Astra 低 13 分。总分能追平,靠的是少编、多承认,不是多知道。
agentic 一直是 Gemini 的短板,这次换了位置。Argon 在 AutomationBench-AA 上拿 77.5% 排第一,比 Claude Sonnet 5.5 的最高档高 6 分;Terminal Bench 4 上 57%,比 Gemini 3.1 Pro Preview 涨了 53 分,排在 Claude Sonnet 5.5、Claude Opus 5.5 和 GPT-6 Astra 之后。
AA-Briefcase 上 1494 Elo,靠的是 65% 的评分表通过率,是它记录到的最高值,但分析质量和呈现质量偏低,分别是 1576 和 1308 Elo。
二是成本账要自己重算。1.99 美元来自 50% 首发折扣加 95% 缓存折扣,折扣结束后回到 3.98 美元,大约是 Astra 的 1.2 倍。也就是说,Argon 的性价比优势靠促销撑着,促销一停就消失,而 Google 还没公布截止日期。
它便宜也不是因为省 token:Argon 单任务平均输出 62k token,Astra 只要 27k,是单价低换来的。标准价每百万输入 4 美元、输出 20 美元,折后 2 和 10,缓存输入折后 0.1 美元。
模型本身:上下文 1M,支持文本、图像、视频、语音输入,只输出文本。还带一个新的 Long Decode Continuation 能力,能把长回答暂停、在后续请求里接着生成,让推理跑满 1M 输出 token 而不断连。
可用状态也要交代:Argon 目前只向部分用户灰度,没有公开可用;50% 是首发推广价,Google 未确认结束时间。想按这个价格做预算的人,得把折扣结束后的 3.98 美元当成常态来算。











