面对ChatGPT每周超10亿用户及每秒7000万次查询的爆发式增长,OpenAI披露了在线存储平台Habitat的架构演进历程,详解如何将Python服务推至极限并最终借助AI重构为Rust。
OpenAI的每一款产品都高度依赖快速、可靠的数据存取——无论是用户登录、检查配置,还是在ChatGPT中开启新会话,每个动作背后往往伴随着多次数据检索。
为此,OpenAI构建了在线存储平台Habitat。如今,Habitat每秒处理超过7000万次请求,为全球近40个区域、每周逾10亿用户提供支持,承载超过500PB数据。而在两年前,它还只是一个连接单一数据库的简单Python客户端库。
Habitat始于一个核心理念:业务研发工程师不应分心于数据库管理。
2024年年中,Habitat最初以Python客户端库的形式上线,底层对接Azure Cosmos DB。它负责屏蔽模式查找、路由、鉴权、加密、序列化与连接池等底层细节,让产品团队只需专注于存取接口。随着产品需求演进,客户端还逐步加入了本地缓存、压缩与加密等能力。
到了2025年年中,客户端库模式遭遇瓶颈。随着OpenAI微服务数量激增,保持向后兼容的协议变更变得极度繁琐。
在一次跨区域故障隔离改造中,团队需要向客户端引入路由逻辑,并通过特性开关(Feature Flag)逐步灰度。这需要协调数十个服务团队依次上线、部署阴影测试、修复Bug。耗时数日准备就绪后,某个业务团队因无关故障回滚了服务,旧版客户端随即引发了原本试图避免的线上故障。
协调部署的脆断与高风险促使团队做出决定:将Habitat解耦为独立服务。独立服务建立了统一的部署、可观测性与功能升级控制面,同时也构成了强健的安全防线,可集中执行访问控制、审计日志,防范来自外部、内部及AI智能体(Agent)的未授权访问。
尽管团队深知在高并发场景下使用Python会导致网络延迟、CPU及内存开销剧增,但在超高速增长期,首要目标是快速解耦业务和保障系统稳定。团队选择承担短期技术债务,并押注未来强大的代码大模型能够协助完成底层重写。
在此架构下,核心技术挑战集中在长尾延迟(Tail Latency)治理:
Habitat放弃了灵活但高风险的任意SQL查询,转而采用受TAO启发的NoSQL数据模型,仅暴露简单的对象(Object)与边(Edge)接口。每个对象与其边在存储层面就近共存,天然支持水平分片,彻底杜绝了大表扫描与跨节点复杂Join引发的单点级联故障。
针对复杂查询与分析需求,团队利用变更数据捕获(CDC)将在线数据准实时同步至Rockset等离线只读引擎,让在线存储彻底免受重度分析流量的干扰。
Python支撑Habitat度过了极速扩张期,峰值处理能力超过每秒2000万次请求。到了2026年第二季度,系统已成为OpenAI CPU核数占用第二大的服务,重构时机终于成熟。
仅由2名工程师借助Codex与GPT-5.5的辅助,团队将整个存储接入服务用Rust彻底重写。目前,Rust服务已承接95%的生产流量,相比Python版本实现了CPU效率提升6倍、内存效率提升15倍,并显著降低了P99长尾延迟。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断