智谱把提速档摆上了货架:GLM-5.3-FlashX(模型码 glm-5.3-flashx)现已上线,最高 200 tokens/s;定价是标准 GLM-5.3-Flash 的 2.5 倍——Coding Plan 与 API 同一口径;API 用户全量开放,Coding Plan 用户走表单申请(链接文末)。
放进今晚的"速度-价格"坐标系里看更有意思:双子发布是直接降价 50%(57417)、阶跃 Step 5 靠低缓存负载把单任务成本钉在前沿(57451)、云上托管 Agent 按醒着的时间计费(57497)——GLM 这步是反向操作:同一个模型切出快档、明码标价 2.5 倍。便宜档买经济,快档买延迟,货架终于摆齐了。
我的看法:这是"把延迟做成商品"的标准姿势——云厂商当年把计算切成普通、预留、竞价三档,如今模型 API 也在走同一条路:同一个模型、不同的钱、不同的等待。对开发者这是笔可以算的账:2.5 倍价格换 200 tok/s,值不值取决于你的任务被什么卡住——交互式补全、流式客服这类被延迟卡住的,快档是刚需;离线批处理这类只被钱卡住的,用标准档就好。
比价时记得 57498 那句提醒:先对齐负载口径——2.5× 是基准倍率,缓存命中率、并发与任务形态还会继续改写真实账单。
速度上限与 2.5 倍定价为发布口径,最终以智谱官方文档与定价页为准。
31 浏览 0 评论
0 反应













