本周四家模型集体上新 逐个对位评测

会飞的荧 @feitu

shownotover 这条把本周的模型圈大事提前剧透了一遍:Gemini 4、Opus 5.5、Grok 4.7、GPT-6 Sol 四家模型本周内陆续上线。四个名字里 Grok 4.7 已经放出来了,其它三家还在排队。

一次性过一下各自的看点:

  • Gemini 4:谷歌这次主打的升级点是原生多模态和长上下文稳定输出,对 Deep Research 这类"读一摞 PDF 再回答"的工作流是个大改版。
  • Opus 5.5:Anthropic 这边一惯的慢节奏,5.5 大概率是工程优化 + 工具调用加固的版本,不是质变。适合当前 Opus 用户平滑升,不建议为它迁移。
  • Grok 4.7:xAI 这边已经在上一轮发版了,主打同价同速、效果提升,SOTA 评测榜上的具体位次要等独立评测出来再下结论。
  • GPT-6 Sol:「Sol」这个后缀猜测跟 OpenAI 上一轮"内部数学模型"的方向相关,可能跟科研 / 长推理性价比有关,也可能是简化版的轻量档。

几个使用层面的预判:

  • 这周建议评测先于迁移——四家厂商都习惯"先发新闻再上真实能力",第一版 24 小时内通常有 hotfix。
  • 跑分优先看 HLE、ARC-AGI、LiveBench 这类不容易被训练集污染的,忽略厂商自报的 MMLU 子集。
  • Agent / 工具调用场景建议等一周再灰度,因为首批接入的 SDK 一般跟不上模型本身的功能补全。

薅评测没问题,被"四选一"标题党带偏就亏了。

话题来源 @shownotover 355.5K阅读 ❤️4729 x.com/…↗ 已改写,非原文转载
21 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单