时间:2026年9月14日(钛媒体报道日期)
地点:全球大模型行业
人物:智谱CEO唐杰;高盛One-Delta负责人Rich Privorotsky;Anthropic CEO Dario Amodei;Uber CTO;Uber COO Andrew Macdonald
事件详情:钛媒体2026年9月14日报道,据Silicon Data的LLM Token支出指数(衡量市场每百万Token平均支付价格),2026年8月单月暴跌29%,首次跌破1美元关口至0.97美元/百万Token。对比今年5月该指数还在2美元以上,短短三个月经历一次"腰斩"。7、8、9三个月,OpenAI、Anthropic、谷歌密集发布新模型:Claude Fable 5.1、Gemini Flash 3.8、GPT-6 Astra先后亮相;国内"Flash"系列扎堆面世,智谱"牛来"GLM-5.3-Flash、阿里Qwen3.8-Flash同天发布,9月10日DeepSeek先下架V4 Pro再发V4.1 Flash,月之暗面发布Kimi K2.8 Preview。各家模型能力节节攀升,定价却走出完全相反的曲线。
背景:今年5月DeepSeek宣布V4 Pro价格永久下调75%,缓存命中输入降至0.025元/百万Token,输出6元/百万Token;8月扛不住成本压力又宣布涨价,说明价格战不是"补贴战",每"刀"都得"尊重"成本曲线。OpenAI 7月30日宣布GPT-5.6 Luna永久降价80%、同系列Terra降价20%,不到一个月又把旗舰GPT-5.6 Sol输入降价20%、输出降价1/3。Anthropic 9月发布的Claude Fable 5.1把缓存读取从1美元降到0.25美元每百万Token,降幅75%。Uber CTO透露每名工程师月均API调用成本高达500-2000美元,公司全年AI工具预算4月就已花完,Meta、Amazon也陆续给员工设置Claude Code、Cursor等AI工具的单月Token上限。Anthropic CEO Dario Amodei曾预测2025-2026年前沿模型训练成本在50亿-100亿美元区间。
影响:Token价格"腰斩"折射大模型行业从"卷能力"转向"卷性价比"的下半场。Flash系列用接近旗舰的性能、远低于旗舰的定价成为用户日常办事主力,本质是用后训练(小模型+强化学习)撬动能力提升,避开昂贵的预训练Scaling Law。智谱唐杰披露GLM-5.3通过加大强化学习和长程任务反馈投入,在总参数与激活参数不变前提下端到端任务完成率比GLM-5.2提升超50%;Qwen3.8-Flash训练开销仅约为Qwen3.7-Plus的1/9。缓存降价则精准补贴增长最快的Agent场景(同一上下文被反复读取)。但价格战也带来副作用:Uber COO承认AI使用量与实际生产功能之间很难联系;Token消耗增速是OpenAI、Anthropic等未上市公司的估值核心支柱,一旦商业空间被压缩,再贵的模型也得放下身段。
总结:LLM Token支出指数三个月腰斩、首次跌破1美元关口,标志着AI行业由"技术是否可行"转向"成本是否可承受"。未来大模型厂商的竞争将从单纯的智力比拼转向能力×成本的综合较量,能用小模型+后训练+缓存优化把"够用"做便宜的公司,将主导下一阶段Token消耗增长;而"既聪明又便宜"将成为新护城河。
参考来源:
- 钛媒体:https://www.tmtpost.com/8139062.html
- Silicon Data(LLM Token支出指数):https://www.silicon-data.com/
- 高盛One-Delta:行业研究报告
- Anthropic:https://www.anthropic.com/news
- OpenAI:https://openai.com/
- DeepSeek:https://api-docs.deepseek.com/news
- 智谱:https://www.zhipuai.cn/
- 阿里通义千问:https://qwen.ai/
- 月之暗面Kimi:https://kimi.moonshot.cn/
- Uber CTO 4月访谈:TechCrunch报道







