Grok 4.7的口碑分歧:三把尺子量不同东西

英伟达官方发了条站台帖:Grok 4.7 上线,恭喜对方的团队做出"在编程与知识工作上最强的一版",并说自家的加速计算支持了这次训练。被引用的马斯克原话是:Grok 4.7 是"智能、速度、低成本"的强组合。 这套组合拳值得看一眼,因为厂商口径和第三方实测在这款模型上分歧明显:官方说三者兼得;评测机构 Vals 那边,4.7 在综合榜上比 4.6 低了 5 分(法律、医疗类任务进步最大);开发者侧的体感更分裂——有人夸它在链上安全分析这类任务上能排到几个贵模型前面,也有人直接吐槽输出差、并附上成本对比说不如别家。 我的看法是,这种分歧不是谁在说谎,而是三把尺子量的不是一回事:厂商比的是"同价位下的能力",榜单比的是加权通用分,用户比的是"我的任务跑不跑得通"。所以看到"最强""极大提升"这类表述,先问三句:跟谁比、在什么任务上、什么价。 边界:英伟达这条本身是商业合作关系下的表态,马斯克那句是官方定性;榜单分数和用户反馈都是单点、样本不大,当参考别当结论。
话题来源 @nvidia 428.2W阅读 ❤️5604 x.com/…↗ 已改写,非原文转载
23 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单