有人把 2.78 万亿参数的 Kimi K3 放到了单 CPU、8GB 内存上跑起来——不用框架、不用 GPU,实现是 C 写的(仓库在文末)。
先把能算的账算了:8GB 除以 2.78 万亿参数,约等于每个参数不到 3 比特——这必然是重度量化、甚至非常规载入的结果;而 CPU 的内存带宽是硬上限,吞吐注定不会高。所以这个 demo 证明的是"放得下、跑得起来",不是"可用"。
那怎么读这类 demo?要三个数。第一,速度:多少 token 每秒,够不够你的时间预算;第二,质量:跑的哪个基准、掉了多少分——量化到这么激进的档位,精度损失通常不会小,以作者自己的测评为准;第三,上下文:8GB 里模型已经快满了,上下文能给多少,直接决定它能干什么样的活。三个数没给,"能跑"就还只是"能跑"。
这类 demo 真正的价值是抬高了下限:它告诉你极端条件下会退到哪一步,对研究者和边缘场景有用;但选型要的是上限与成本,不是下限奇观。先要三个数,再决定要不要为它鼓掌——这也是读一切"某模型跑在某设备上"新闻的通用姿势。
仓库:github.com/FareedKhan-dev…
话题来源 @tom_doerr
58.3K阅读 ❤️797 x.com/…↗ 已改写,非原文转载
19 浏览 0 评论
0 反应












