一天用下来:Grok4.7是性格换了

我不是小布丁 @xiaobuding

一篇把跑分先放一边的 Grok 4.7 一天实测。作者的筛选立场开篇就摆明:只引公开跑分的"它很烂"报告直接忽略——"同一批跑分还说过 Opus 5 比 Fable 强呢";拿 3D 小游戏比模型的也忽略——那不是真实工作,是社媒搏眼球。

他把 4.7 当"大副"(firstmate)主力用了一整天,结论是明显强于 4.5(4.6 他干脆跳过,体验里 4.5 更好使)。

先把他的方法论立场单拎出来说:他删掉的两类报告——只跑分的玩 3D 小游戏的——恰好是社媒上声量最大的两类。前者把多维能力压成一个数,后者把"能玩"当成"能干活";而他选择的替代方案是拿一整天当主力用、记录行为差异。这种定性长测的样本量小,但它测的是跑分测不到的东西:行为是否可预期

四条观察:

一、系统提示跟得极紧。 他第一次见到这些新行为:让他点名说出哪些红色 CI 检查可以接受被绕过、并且拒绝一句简单的"yolo"指令。他回头查了自己的 firstmate 系统提示,措辞确实这么写——此前没有任何模型跟到能显形的程度,4.7 是第一个把它做出来的。同类例子还有几个,他认为这是明确的行为差异。

二、非常"稳"。 用过 Astra 的人知道什么叫"尖峰"模型:有天才时刻,也常有"怎么会蠢到不懂我"的瞬间。4.7 相反——一整天下来他承认还没遇到"哇,这波绝了"的时刻,但稳定、无大惊喜、行为可预期,这份可预期让他很快建立起信任。

三、偏保守。 不询问就不动手,而且会明说。他自己说这是双刃剑:有时他得把显而易见的事再说一遍("是的,我要"),但回头看,那些场景确实有歧义,模型未经确认就自作主张未必是他想要的

四、比 4.5 更慢、更贵,肉眼可见。 每轮耗时变长,额度掉得明显更快——他坦言还没量化出钱从哪儿漏的

把第四条和昨晚那篇从账单出发的 4.7 差评放一起,就形成了难得的交叉验证:那篇算出真实成本是 4.6 的两倍以上,这篇没量化却独立观察到"额度肉眼可见地掉"——两位不同作者、不同方法,指向同一个方向:4.7 的账单压力是真的。一个从钱倒推,一个从体验正推,结论重叠的部分可信度最高。

第二条也值得展开:"稳"为什么值钱。可预期的信任是复利——模型行为越可预测,你越敢放手给它更长的任务、更大的权限,吞吐反而上去了;单点的"天才时刻"做不到这一点,因为你不知道下一轮它是天才还是傻瓜。对每天要跑几十次的主力模型,可预期性直接等于产能

第三条的工程含义同样直白:保守型模型适合有审批文化的团队——它那套"先问再动"正好对上变更需要留痕、权限需要收敛的场景(他点名的 CI 白名单就是典型);但快糙猛的探索期会嫌它磨叽。"更听话+更稳"值多少,取决于你的任务容错,这句可以当选型口诀。

总评:特征差异清晰、他大多是喜欢的,会继续当主力并接着观察;结尾还向读者征集真实使用的定性感受——跑分满天飞、单点成本测零星,这种"用了一整天的定性描述"恰恰是社区现在最缺的那类数据

顺着他的四条观察,能整理出三件立刻可用的事:其一,想吃满"听话",就把边界写进系统提示——可绕过的检查项、需要确认的动作类型,写死它就会真执行(他的 CI 白名单例子就是这么显形的);其二,按阶段分工模型——探索期要发散、要快,未必用它;进入要留痕、要审批的收敛期,保守反而是加分;其三,额度要设告警——他自己没量化出钱漏在哪儿,使用者就得自己盯:更慢的轮次乘上更快的消耗,最容易在月底才发现。

我的看法:三类信息源要一起用——跑分、单点成本实测、定性长测,缺一个都会误判。4.7 不是单轴变强,而是性格重排:更听话、更稳、更保守,同时更慢更贵;升级从来不是"变强"一个词能概括的。而他的观察方法本身也可复制:同一句系统提示在几个模型上跑一遍,看谁能把行为做显形——这比任何跑分都更接近你要的答案。

限定:一人一天的定性观察,任务集与额度消耗均未量化(他自己也这么说)。

话题来源 @kunchenguid 445.2K阅读 ❤️1936 x.com/…↗ 已改写,非原文转载
26 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单