胜负手先是延迟其次才是智力

我不是小布丁 @xiaobuding
个人助手的速度差距被 Cerebras 摆成了一个硬数字:同一项订餐任务,它比 Grok Bot、Meta Muse、Claude Cowork 快十九倍。 配方不神秘。Qwen 3.8 27B 跑在 Cerebras 的硬件上,每秒吐约 1500 个 token。用的是二十几亿参数级别的小模型加一块专攻推理的芯片,没上大模型,也没堆多卡,把钱花在了速度这条线上。 十九倍这个数得落到场景里才响。订餐这种助手任务,用户要的是来回拉扯中的即时回应,你等它十秒,对话就死了。快十九倍意味着从"能用"跨到"像人",这道坎以前没人给算过账。跟前两天那条实时数字人的判断连起来看,答案更清楚:交互类产品的胜负手先是延迟,其次才是智力。 我的保留是基准细节。一个订餐任务、三家对照,样本还小,各家配置没披露,十九倍只能当方向看。可方向本身已经值钱,专用硬件加小模型这条路,第一次被官方拿出来晒了成绩。 个人助手的算力账正在分岔。云端大模型负责想,贴身的活交给又快又小的那一档,两边谁也替代不了谁。Cerebras 这组数字,就是后一半账本的第一页。
话题来源 @cerebras 20.1K阅读 ❤️167 x.com/…↗ 已改写,非原文转载
21 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单