企业花了大价钱买GPU跑起来的部分还不到5%——这件事正在把AI采购的逻辑彻底变了
企业花了大价钱买 GPU,跑起来的部分还不到 5%——这件事正在把 AI 采购的逻辑彻底变了。
Cast AI 刚发布的 2026 年 Kubernetes 优化报告用了 23000 个集群的生产遥测数据,结果一出来就让行业内很多人睡不着觉:企业 GPU 平均利用率只有 5%,意味着你花了能跑满 20 台机器的钱,实际只跑亮了 1 台。
不是个别现象。VentureBeat Research 六月调查了 573 家有 100 人以上的科技公司,86% 的企业自述 GPU 利用率在 50% 以下。Gartner 估算 2026 年 AI 基础设施新增支出会达到 4010 亿美元——而这些钱里有相当大一部分是在给闲置机器交电费。
一个 H100 空闲着,光电费每年就要烧掉 250 到 600 美元,还不算冷却系统的开销。你买的不是 GPU,是一台 24 小时运转的烤箱。
为什么利用率上不去
问题不是缺需求,是结构性的。
第一是采购逻辑。企业买 GPU 不是按实际负载买,是按恐惧买。英伟达订单积压几个季度,拿到货比什么都重要,于是团队倾向于超额预订——反正抢到就是赚到,用不用得了以后再说。结果是锁进去的算力成了沉没成本,越不用越不舍得释放,因为一旦还回去,下次可能就抢不回来了。
第二是工作负载天生有波峰波谷。训练任务周期性强且密集,一段时间把机器跑满,接下来几周可能完全闲置。推理负载跟着业务时间走,白天繁忙,夜间基本停摆。一个按峰值配置的集群,平均利用率自然高不了。
第三是团队各自为战。GPU 分配给特定项目或模型后,跨团队调度没有机制——A 团队的机器跑不满,B 团队在排队等货,capacity 躺在那里 nobody can touch。技术工具是现成的,但解决不了组织问题。
利用率 5% 和 50% 之间差了什么
Cast AI 的数据里有个关键参照:经过优化后,GPU 利用率可以稳定在 50% 左右。这意味着从 5% 到 50%,不是靠买更多硬件,而是靠把现有的跑起来。
具体怎么做?一是把 GPU 从独占分配改成共享池,让波峰波谷互相削峰填谷;二是对推理和训练任务做 batching 合并,减少空转;三是上自动化调度,实时监控实际负载而不是盯着峰值配置;四是接入 spot instance 或弹性云,把固定成本变成可变成本。
但最根本的改变可能要发生在财务层:当 GPU 利用率从技术指标变成 ROI 指标,CFO 开始问「你这台机器一年跑了几小时」,采购逻辑才会真正变。
大厂还在砸钱,小厂在算账
有意思的是,GPU 浪费最严重的不是初创公司,反而是已经有一定规模的传统企业。初创公司每一分钱都算得清楚,买了 GPU 就想办法用起来;大企业有预算空间,反而容易出现「买了放着当保险」的逻辑。
与此同时,hyperscaler 的资本开支还在狂飙。微软、Google、亚马逊、Meta、Oracle 今年的资本支出加起来接近 7000 亿美元,是 2025 年的将近两倍。这些钱最终还是要从企业口袋里收回来——问题是,当企业发现自己的 GPU 5% 利用率的时候,他们会不会重新评估这笔账值不值?
SaaS Sentinel 的报告中有一句话很直接:CTO 们应该在签下一个 GPU 合同之前,先把自己现有的库存审计一遍。
这句话背后是一个正在成形的趋势:AI 基础设施的竞争,正在从「谁买得多」转向「谁用得精」。
评论区
登录后可评论。