来自马斯克 AI 团队成员的一线证言,1700 多赞:"Grok 4.7 好到爆——但模型已经不是瓶颈了,我相信 harness 的可靠性以及它周围的一切才是。"
真正让他惊讶的是用户评论的形状。他读了自己那篇"Week 1 at SpaceXAI"下几乎每一条留言,发现几乎没人喊"把 Grok 做得更聪明",全在喊同一件事:让 agent 把活干完。
他把诉求压缩成四个别:别半途而废、别丢了浏览器、别忘了自己在干什么、别卡在那里等我发现。然后给了句判断:这其实是"幸福的烦恼"——人们已经在拿 Grok 干真活了,现在该轮到系统的其余部分配得上模型的能力。
工具、浏览器、记忆、状态、重试、错误处理……模型完全知道该做什么,agent 仍有一百种死法;他最后留了个预告:正在修其中一些。
这段话把本周两块拼图对严丝了。第一块,"模型只是及格线、结构才是成败"那篇的官方回声——只是这次来自对手阵营:Grok 的人自己说模型够了、系统拖后腿。第二块更妙,它和 Cherny"别折腾脚手架"那篇看着打架,其实说的是两码事:Cherny 反对的是替模型补位的细碎规则(那 10–20% 会被下代抹掉),而这条讲的是让 agent 不死的系统件——状态保持、断点重试、浏览器续命、错误兜底。
前者该删,后者该建;判断标准就一条:这个东西在解决"模型不够聪明",还是在解决"系统不可靠"——前者会贬值,后者只会更值钱。
四个"别"值得裱起来当清单,因为它全是失败模式,不是能力问题:半途而废(任务状态丢了)、丢浏览器(会话断了)、忘任务(上下文没了)、卡住不报(死循环没有出口)。这四样没有一样能靠"换个更强的模型"解决——它们是管线的病,不是大脑的病。这也是为什么"能写成代码的约束别留在提示词里"那条在实践里成立:重试次数、超时出口、状态落盘,这些从来就该是代码层的硬逻辑。
留一格清楚的边界:这是一线员工的观察与预告,具体改进没有时间表与细节;"没人喊更聪明"是单帖评论区的样本,不代表全部用户。但方向可信——当最强模型的团队都在修可靠性,你就知道该把自己的力气放哪了。
给还在死磕模型选型的人一句落地的:给你手头的 agent 列一张"四种死法"清单——上次它卡在哪、断在哪、忘在哪、哪次没等你就放弃;逐条给个兜底(落盘、超时出口、断点续跑、进度上报)。四条补完,你大概率比换个更贵的模型收益大——这周从评测到安全到 harness,所有线索最后都收在这句话上:先让它别死,再谈让它更聪明。













