时间:2026年9月22日
地点:美国旧金山
人物:OpenAI产品团队、GitHub首席产品官Mario Rodriguez、Strawberry Browser Manus Wordsmith首席技术官Arian Hanifi
事件详情:OpenAI于9月22日为GPT-6系列推出改进版提示词缓存机制,默认情况下提供更高的缓存命中率,并在30分钟窗口内对复用的共享前缀给予最高90%的输入token折扣。同日上线的Prompt Caching Dashboard可展示应用输入中来自缓存的比例、按时间追踪命中率,并通过输入构成图表对比已缓存与未缓存的token;Prompt Caching Diagnostics工具则可在意外未命中时对比当前请求与近期响应,定位是模型、工具、设置还是输入变化导致无法复用,并估算受影响的token数。新版机制还引入显式缓存断点,允许开发者自行标记可复用前缀;调整推理强度时通过追加configuration_update即可保留缓存,不再因切档而清空;预热缓存功能可在用户首次提问前提前处理共享指令、工具定义与参考文档,缩短响应时延。
背景:GPT-6主打持久智能体连续工作数小时的能力,应用通常发出连串彼此承接的API请求,复用前几轮的指令、工具定义和上下文。OpenAI此前已通过缓存复用计算来降低响应时延,但默认命中率较低、缓存失效原因对开发者近乎黑盒;GitHub Copilot此前按原缓存方案需重新处理的prompt token占比居高不下。
影响:GitHub Copilot首席产品官Mario Rodriguez表示,过去数月新方案使其数十亿次请求中需重新处理的prompt token占比下降超过50%。Strawberry Browser Manus Wordsmith CTO Arian Hanifi称,诊断工具与显式断点将其缓存命中率提升数个百分点,成本下降20%。对长任务Agent而言,缓存稳定性直接决定时延与账单,把时间戳、随机会话ID等易变字段前置会导致前缀频繁失效,从而按全价计费。
总结:OpenAI通过默认命中率提升、30分钟复用窗口、诊断工具和显式断点,把缓存从被动折扣变成可调优的工程对象,长跑Agent与代码助手将成为首批受益方。
参考来源:https://openai.com/index/better-prompt-caching-for-gpt-6
参考来源:https://newsroomamerica.com/a/W83cdd5TWUj1XN1bykKgQjYxb3Y/openai_launches_improved_prompt_caching_for_gpt_6_with_higher_default_hit_rates_a_caching_dashboard_diagnostics_tools_and_explicit_cache_breakpoints_cutting_cached_input_token_costs_by_up_to_90.html
参考来源:https://news.bpdata.com/article/openai-improves-gpt6-prompt-caching-to-boost-hit-rates-and-f9027d80
参考来源:https://news.lavx.hu/article/openai-improves-gpt-6-prompt-caching-with-diagnostics-and-30-minute-reuse-windows
参考来源:https://metallab.ai/en/2026/9/openai-gpt-6-prompt-caching
参考来源:https://www.36kr.com/p/3995185351544969
参考来源:https://news.qq.com/rain/a/20260923A05YB600







