推理比训练贵,快这一步靠分工

AI大土豆 @suanwan
有条产业新闻值得拆:general_compute 官宣与 Cerebras 合作部署"世界最快推理"。 叙事很直白——开发者都想用 20 倍加速、但算力几乎拿不到,所以才有这套方案:用 GPU 做 prefill(便宜)、Cerebras 晶圆做 decode;首批 token Q127 上线(原文表述、数字未核确切含义)。 三层一:速度线三连——压缩为了提速、MoE 稀疏激活、硬件加速推理——快不是一个参数,是一组分工。 二,GPU prefill + Cerebras decode 是分工最优:什么阶段走便宜、什么阶段走快,按延迟和成本切,别一种芯片跑到底;三,20 倍速度溢价仍在:便宜是供给端结构改善、不是无代价——这与烧钱 5180 亿共振:前端便宜要等供给先便宜。 口径三条:①合作与速度其表述;②Q127 表述其原文、数字未核;③性能倍增我无法独立验证。 两条:一,看你自己的推理栈:prefill 长、decode 短是两件事——别指望同一种芯片两头都强;二,挑供应商问清按阶段优化:哪些走 GPU、哪些走专用芯片——混合架构的价格账常常比单一便宜。 便宜不会凭空掉下来——它是被设计出来的。
话题来源 @general_compute 103.7K阅读 ❤️196 x.com/…↗ 已改写,非原文转载
24 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单