训练侧的解释终于来了:xAI 的工程师说,4.7 是在"更长的持续性问题"上训练出来的(对照 4.6),效果点名两条——上下文保持得更好、更仔细地自查自己的工作;被引用的官方发布帖则强调:这是同价、同速下的显著提升。
这一条正好把前面两篇的现场接上了:昨天那篇一天实测观察到"更稳、更保守、会自查"(连"拒绝一句 yolo"都对得上"自查自己的工作"),而成本账那篇实测出"每任务更贵、轮次更慢"——注意两种口径并不必然打架:官方的"同价同速"说的是标价与基准设置,两位实测者说的是自己任务形态下的实际消耗(effort 档位、任务结构、缓存命中都会改写真实账单)。读这类消息的动作就一个:把"标价"和"每任务成本"分开看。
我的看法:从"按更长任务训练"这七个字,能反推这一代的优化目标——不是刷短题分数,而是压低长程工作流的失败率:hold context 是少丢约束,self-check 是把返工拦在提交之前——这也正是 day-1 观察里"可预期、敢放手"的来源。
训练目标定成长程,用户的体感才会是"稳";同时解释了它为何在"听话"上进步明显:长任务的训练样本本身就奖励服从性。
训练细节按工程师自述,官方未公开配方;"同价同速"为发布口径。
22 浏览 0 评论
0 反应














