时间:2026年9月14日
地点:全球大模型行业
人物:DeepSeek、月之暗面(Kimi)、智谱、阿里通义千问、OpenAI、Anthropic、Google
事件详情:据 Silicon Data 的 LLM Token 支出指数(计算市场每百万 Token 平均支付价格)显示,2026 年 8 月单月该指数暴跌 29%,跌至 0.97 美元/百万 Token,首次跌破 1 美元关口;对比今年 5 月仍在 2 美元以上,短短三个月即遭遇"腰斩"。9 月第一周,OpenAI、Anthropic、Google 接连发布 Claude Fable 5.1、Gemini Flash 3.8、GPT-6 Astra 等新模型,叠加 DeepSeek V4 Pro 9 月 10 日下架由 V4.1 Flash 接棒降价,Token 单价进一步下压。
背景:DeepSeek 5 月曾将 V4 Pro 价格永久下调 75%(输入缓存命中 0.025 元/百万 Token、输出 6 元/百万 Token),后于 8 月因成本压力反弹涨价,揭示"补贴战"难以维系。OpenAI 7 月 30 日将 GPT-5.6 Luna 永久降价 80%,同系列 Terra 降价 20%;不到一月又对刚发布的旗舰 GPT-5.6 Sol 输入降价 20%、输出降价 1/3。Anthropic Claude Fable 5.1 维持基础定价但把缓存读取价从 1 美元压至 0.25 美元/百万 Token,降幅 75%。Qwen3.8-Flash 训练开销约为 Qwen3.7-Plus 的 1/9;Kimi K2.8 Preview 为接近 K3 性能的高效版本,命名倒退体现"Flash 化"思路。
影响:行业进入"能力通胀、价格通缩"阶段。高盛 One-Delta 部门负责人 Rich Privorotsky 指出,AI 大模型已由"技术是否可行"转入"成本是否可承受"的下半场。Flash 模型正成为日常 Agent 任务主力——智谱 GLM-5.3-Flash("牛来")、Qwen3.8-Flash、Kimi K2.8 Preview、DeepSeek V4.1 Flash 共同压制旗舰 API 利润空间。Anthropic、DeepSeek 通过"砍缓存读取价"补贴 Agent 场景——一次任务反复读取同一长上下文数十至上百次,缓存价格战直接覆盖推理成本增长最快的赛道。OpenAI 改走"输出 Token 压缩"路线,即便 API 单价上涨 2.5 倍,单次任务总价仍下降。
总结:大模型价格三月腰斩标志着竞争从"谁更聪明"全面转向"谁更便宜"。Flash 模型成为旗舰替代品、缓存读取价成为新补贴战场、Agent 场景成为流量入口,三条主线共同重塑大模型商业模式。开源能力追平+Agent 规模化让 1 美元/百万 Token 关口后,下一个角力点是 Token 消耗量的工程化优化。
参考来源:https://www.tmtpost.com/8139062.html
参考来源:https://www.silicondata.com/llm-token-index
参考来源:https://api-docs.deepseek.com/zh-cn/news/news260910/
参考来源:https://openai.com/index/gpt-6-astra/
参考来源:https://www.anthropic.com/news/claude-fable-5-1
参考来源:https://qwen.alibaba.com/
参考来源:https://www.moonshot.cn/







