Ember-1 官方口径来了,Fireworks 的 dzhulgakov 一句话把卖点说完:"我们团队做的——Kimi K3 后训练版,推理简洁 40%;同质量,快 40%、便宜 40%",并提到它正在 Hacker News 上被热议。(转述自原帖,细节与数据以 Fireworks 官方为准)
把这条与前几日的观察拼起来,效率账本又厚了一页。此前的实测版告诉我们:Terminal-Bench 2.1 上 82.0 对 K3 的 80.9、真实 coding 流量里推理 token 降七成、总 token 降近四成而成功率几乎不动;方法是用真实 agent 循环做 RL,教模型分清"改答案的思考"与"原地打转的废话"。
官方版再补三连口径:同质量、快四成、便宜四成。两条线合起来指向同一个判断——推理模型的浪费不在"想"本身,而在"想了又想的同一件事":压缩废话不损失质量,说明此前的冗余本来就是冗余。
这也解释了为什么"推理提供商自己下场给开源权重做效率后训练"这条路被普遍看好。模型能力的天花板由前沿实验室决定,但把天花板下方的空间挤干净,是运营者的活:同样的钱、同样的任务,少烧四成 token、快四成交付——在 agent 成队、任务成河的当下,这类优化的复利远比单点跑分显眼。
今晚从"能省的是翻译"到"调度里每一分",再到今天的"剪掉原地打转",效率的三个来源已经齐了:接口层省翻译、调度层省等待、思考层省废话。
留一格清醒:40% 是官方口径与特定基准下的数字,不同任务的收敛幅度会差很多;方向可期、具体以自己跑分为准——这正是"信方向、别抠小数点"那篇的用法再用一次。
给想上手的人一句落地的:这类"简洁版"模型最适合当循环主力——让它在 agent 里跑迭代与改稿,把原版留给你最后一公里的关键判断;先拿你自己的真实任务各跑十次对比成本与成功率,四成的节省是它的承诺,你的十次才是你的结论。
















