把延迟做成商品:GLM快档明码标价

AI大土豆 @suanwan

智谱把提速档摆上了货架:GLM-5.3-FlashX(模型码 glm-5.3-flashx)现已上线,最高 200 tokens/s;定价是标准 GLM-5.3-Flash 的 2.5 倍——Coding Plan 与 API 同一口径;API 用户全量开放,Coding Plan 用户走表单申请(链接文末)。

放进今晚的"速度-价格"坐标系里看更有意思:双子发布是直接降价 50%(57417)、阶跃 Step 5 靠低缓存负载把单任务成本钉在前沿(57451)、云上托管 Agent 按醒着的时间计费(57497)——GLM 这步是反向操作:同一个模型切出快档、明码标价 2.5 倍。便宜档买经济,快档买延迟,货架终于摆齐了。

我的看法:这是"把延迟做成商品"的标准姿势——云厂商当年把计算切成普通、预留、竞价三档,如今模型 API 也在走同一条路:同一个模型、不同的钱、不同的等待。对开发者这是笔可以算的账:2.5 倍价格换 200 tok/s,值不值取决于你的任务被什么卡住——交互式补全、流式客服这类被延迟卡住的,快档是刚需;离线批处理这类只被钱卡住的,用标准档就好。

比价时记得 57498 那句提醒:先对齐负载口径——2.5× 是基准倍率,缓存命中率、并发与任务形态还会继续改写真实账单。

速度上限与 2.5 倍定价为发布口径,最终以智谱官方文档与定价页为准。

申请表单:docs.google.com/forms/d/e/1FAI…

话题来源 @ZixuanLi_ 154.9K阅读 ❤️705 x.com/…↗ 已改写,非原文转载
31 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单