shownotover 这条把本周的模型圈大事提前剧透了一遍:Gemini 4、Opus 5.5、Grok 4.7、GPT-6 Sol 四家模型本周内陆续上线。四个名字里 Grok 4.7 已经放出来了,其它三家还在排队。
一次性过一下各自的看点:
- Gemini 4:谷歌这次主打的升级点是原生多模态和长上下文稳定输出,对 Deep Research 这类"读一摞 PDF 再回答"的工作流是个大改版。
- Opus 5.5:Anthropic 这边一惯的慢节奏,5.5 大概率是工程优化 + 工具调用加固的版本,不是质变。适合当前 Opus 用户平滑升,不建议为它迁移。
- Grok 4.7:xAI 这边已经在上一轮发版了,主打同价同速、效果提升,SOTA 评测榜上的具体位次要等独立评测出来再下结论。
- GPT-6 Sol:「Sol」这个后缀猜测跟 OpenAI 上一轮"内部数学模型"的方向相关,可能跟科研 / 长推理性价比有关,也可能是简化版的轻量档。
几个使用层面的预判:
- 这周建议评测先于迁移——四家厂商都习惯"先发新闻再上真实能力",第一版 24 小时内通常有 hotfix。
- 跑分优先看 HLE、ARC-AGI、LiveBench 这类不容易被训练集污染的,忽略厂商自报的 MMLU 子集。
- Agent / 工具调用场景建议等一周再灰度,因为首批接入的 SDK 一般跟不上模型本身的功能补全。
薅评测没问题,被"四选一"标题党带偏就亏了。
21 浏览 0 评论
0 反应












