时间:2026年9月11日
地点:美国旧金山 OpenAI 总部
人物:OpenAI 工程师团队 Jon Lee、Chaomin Yu、Ben Ries(均为 Members of Technical Staff)
事件详情:OpenAI 工程团队于 9 月 11 日发布技术博客《Rapidly scaling online storage to serve over 1 billion ChatGPT users》(上篇),详细拆解其内部在线存储平台 Habitat 的演进历程。Habitat 现已承载每秒 7000 万次以上请求、每周服务超 10 亿用户、存储总量超 500 PB,覆盖近 40 个地理区域,支撑 ChatGPT、API、Codex 及内部服务等全部 OpenAI 产品线。两年前 Habitat 还只是一个对接 Azure Cosmos DB 的简易 Python 客户端库,如今已演化为分布式存储平台层,负责请求路由、ACL 鉴权、数据驻留、加密、隔离、限流、模式查找等全部逻辑,并接入 Valkey 缓存与 Blob 存储。OpenAI 同时预告下篇将深入多租户可靠性、分层读性能优化以及与 Azure Cosmos DB 的大规模协作方案。
背景:Habitat 项目始于 2024 年中,最初目标是把数据库管理细节封装起来,让产品工程师不必关心 schema、路由、鉴权、加密、序列化、请求整形、连接池等底层问题。其基础设施栈以 Azure Cosmos DB 为主存储,配合 CDC 服务(Kafka、Rockset、Databricks)做变更数据捕获与流式分发。过去三年 OpenAI 业务连续保持 10 倍以上同比增长,Habitat 也随之从单库 Python 库演化为独立服务,近期又启动向 Rust 迁移以提升可靠性。Habitat 团队的成长策略是一边深挖既有栈、把每一层榨到极致,一边用更基础的重构换取容量缓冲时间。
影响:Habitat 的公开意味着外界首次得以窥见 OpenAI 在超大用户量下的存储工程实践,也回应了 ChatGPT 历史上多次因数据访问层卡顿引发的体验争议。500 PB 量级、70M RPS、近 40 区域的服务规模在公开资料中属于罕见的 AI 公司自营存储案例,对构建高并发 LLM 应用、Codex 类编码代理、以及后续 Agents API 等场景都有直接参考价值。OpenAI 通过该博客同时释放两个信号:一是底层基础设施已经能够稳态支撑十亿级周活;二是其工程团队正在为下一波多租户、性能优化和 AI 代理场景做底层重构。
总结:OpenAI 用一篇长文披露 Habitat 从 Python 库到全球分布式存储平台的完整演进路径,亮出 70M RPS、10 亿周活、500 PB、近 40 区域的硬指标,展示了支撑 ChatGPT 的"看不见的骨架"。这篇博文既是技术披露也是工程宣言,预示着 OpenAI 正在把基础设施成熟度与产品野心放在同一天平上衡量。
参考来源:
1. OpenAI 官方博客(上篇):https://openai.com/index/scaling-storage-one-billion-users-part-one/
2. Databubble 报道:https://databubble.co/news/rapidly-scaling-online-storage-to-serve-over-1-billion-chatgpt-users
3. StuffThatSpins 分析:https://stuffthatspins.com/spin/rapidly-scaling-online-storage-to-serve-over-1-billion-chatgpt-users
4. 腾讯新闻 IT 时代网中文报道:https://news.qq.com/rain/a/20260912A00YDE00
5. AI HOT 精选条目(数字生命卡兹克运营):https://aihot.virxact.com









