有个听上去像科幻的基建方案,已经真实发生在 2026 年:一个中国初创团队把大约 1000 台 Mac Mini M4 塞进数据中心,完全用本地算力跑 AI、完全不依赖云端。
账面摆出来相当有说服力。单台起价 599 美元,满载功耗只有 10–30 瓦——传统 GPU 服务器是 300–500 瓦;一千台堆在一起,成本可控、电费低得惊人。他们这么做的动机也直白:把 AI 算力从每月高昂的云服务账单里赎出来,握在自己手里。
据原帖,这套集群已经被用在需要真金白银产出的实际业务上跑自动化策略(案例细节以原帖与官方为准)——不是实验室展品,是在挣钱的机器。
"云租 vs 自建"这笔账能在这个规模上翻盘,靠的是两个叠加的变量:单位能效的持续提升(M4 这类芯片的每瓦性能已到可用水平),和用量的规模效应(一千台的电费与运维摊薄到足够低)。
这与今晚反复出现的那条主线完全同源——省的层级从"每次调用"上移到"每瓦、每台、每月":档位省的是思考、蒸馏省的是步数、假依赖省的是等待,而这次省的是整个供给方式。当效率优化做到尽头,剩下的问题就变成了"该买还是该租"。
这类自建方案真正的门槛也不在硬件,在另外三处:调度(一千台要有人把任务分匀、把故障机器摘出去)、模型适配(本地集群跑什么尺寸的模型、量化后掉多少精度)、以及折旧(硬件会老,模型会变,账要按周期算)。
这三样没有捷径——它们正是今晚"薄 harness"、"看住并行"那些讨论在物理世界的对应物:机器一多,管理就从配置问题变回了工程问题。
给在算这笔账的人一句落地的:先别买一千台——拿你过去三个月的云账单,除以"本地方案的等效功耗成本",看回本周期落在几个月还是几年;再把你的真实负载(常驻推理、批量离线、突发峰值)拆开,各占多少。回本快、负载稳的那部分适合自建,突发与探索继续留在云上——混合才是这个规模上的常态,全本地是算出来的结果,不是信仰。














