OpenAI推出GPT-5.6模型家族,旗舰版Sol推理性能超越Claude Fable 5,成本不到一半;Terra性能持平GPT-5.5但价格减半;Luna价格仅为Sol的20%。效率提升来自推理栈和智能体框架的全栈优化。

OpenAI 设计 GPT-5.6 模型家族的目标,是在用户常用的各类任务中实现能力与成本的平衡。旗舰模型 GPT-5.6 Sol 在开启最大推理模式时,以不到 Claude Fable 5 一半的成本,在 Artificial Analysis 编程智能体指数上超越后者。Terra 的智能水平与 GPT-5.5 相当,但价格仅为一半;Luna 则是速度最快、价格最低的模型,定价比 Sol 低 80%。为实现这些效率,OpenAI 的研究和技术团队在栈的每个主要层面进行了重大优化。这些改进涵盖模型本身、推理(如何运行模型生成输出)以及智能体框架(Codex 和 ChatGPT Work 均使用此框架)。
过去四年,OpenAI 将模型扩展至 10 亿活跃用户和超过 200 万家企业,效率一直是让智能普惠的关键。使命是确保通用人工智能(AGI)造福全人类。这些年来,OpenAI 不断在栈中解锁更大优化,以在每个成本-智能曲线上提供最性能的模型。GPT-5.6 实现了每 token 智能效率的新高,其训练目标是让每个 token 完成更多工作。训练中同时优化任务成功率与效率,引导模型通过更直接的路径完成任务。
本文重点介绍模型之外的两大效率设计:1) 推理——通过负载均衡、投机解码、缓存和内核优化等流程优化,从相同硬件中获取更多输出;2) 智能体框架——更好地管理上下文膨胀、工具使用和重复工作。还将介绍 GPT-5.6 Sol 如何自主实现其中多项增益。虽单项改进看似有限,但这些收益复合叠加,使 OpenAI 能够同时提供前沿智能与前沿效率。
在计算资源受限、模型需求增长快于容量的世界里,效率是系统设计的核心。推理栈尤其如此,它运行训练好的模型来生成响应。首要目标是用相同硬件服务更多 token,同时保持用户期望的智能度、延迟、可用性和可靠性。
实现这一目标需要优化整个系统。一个模型单独看可能高效,但如果请求分布不均、硬件闲置或数据传输拖慢计算,服务成本仍会很高。各层改进相互叠加:路由(请求发往何处)、调度(何时发送请求)、内核(在 GPU 上运行的软件)、缓存(保存和重用计算结果)以及模型实现(GPU 代码的执行顺序)。GPT-5.6 Sol 在 Codex 中发挥了关键作用。
第一个重要例子是负载均衡。全局层面,OpenAI 根据地理位置、可用容量和加速器类型(GPU 或专用芯片)路由请求。在集群内,根据负载、上下文长度、缓存可用性和其他请求属性将工作分配到不同模型实例。每个实例内部,工作需高效地分配到加速器、模型子网络和计算核心。GPT-5.6 Sol 在 Codex 中帮助分析生产流量,发现先前被忽视的不平衡源,测试新路由策略,并不断调整这些启发式规则。仅负载均衡改进就大幅降低了模型服务成本。
OpenAI 还使用 GPT-5.6 Sol 优化模型的前向传播:将输入转换为下一次 token 预测的计算。即使单个运算很快,多余的内存移动、同步和低效的数据布局也会导致 GPU 空闲。为避免这点,GPT-5.6 Sol 找到了可以预计算、避免或并行化的工作。在 Codex 中,GPT-5.6 Sol 自主重写并优化了生产内核——执行构成模型数学运算的核心代码。这得益于 OpenAI 训练 GPT-5.6 使其擅长用 Triton 和 Gluon(OpenAI 维护的两个开源 GPU 编程语言)编写和改进内核。这些努力与 GPT-5.6 Sol 带来的更广泛内核优化相结合,将端到端服务成本降低了 20%。OpenAI 还大力投资了验证工具,如开源工具 FpSan(浮点清理器),用于验证 GPT-5.6 Sol 所写内核的正确性。
投机解码是另一个提高速度和效率的杠杆。该技术在主模型旁运行一个较小的草稿模型(“投机者”),提出多个 token,让主模型并行验证。当这些提议被接受时,系统可以从单次主模型前向传播中产生多个输出 token,减少昂贵的串行计算量。GPT-5.6 Sol 通过设计并运行数百次架构实验来改进自身草稿模型,测试大小、结构和特征的变化。此外,GPT-5.6 Sol 启动并监控了投机者的训练过程,当出现硬件故障和训练不稳定性等问题时自主干预。这些改进使 token 生成效率提高了 15% 以上。
处理未缓存的输入 token 时,模型在一次密集计算中构建键值(KV)缓存;生成输出时,重复读取和扩展该缓存。最佳服务配置(如批处理、分片和 KV 管理)高度依赖工作负载——提示和输出长度、批大小、缓存命中率、查询特征等。然而,配置空间先前太大,无法系统调参,工程师只能依赖粗略启发式。借助 Codex 中的 GPT-5.6 Sol,OpenAI 能够分析生产工作负载,生成并评估候选配置,超优化引擎和模型在每个场景下的配置。这使得特定工作负载的优化达到新水平,从相同硬件中提取更多有用的推理结果。
推理优化是一个持续反馈循环。测量生产行为,识别最大差距,实施变更,验证是否改进了整个系统而非孤立基准。GPT-5.6 Sol 和 Codex 加速了循环的每一部分,使团队能探索更多想法,更快响应变化的工作负载,为用户提供更低延迟、更高容量和更低成本的推理栈。
ChatGPT Work 和 Codex 通过一系列模型请求和工具调用来完成复杂任务。在单次交互(从用户请求到最终响应)中,Codex 可能检查源代码、搜索部署历史、阅读事故报告、编辑文件并运行测试。每一步都可能需要一个请求。
准备上下文、传输数据、运行推理、调用工具和启动进程都需要时间和计算。如果一个任务需要 30 次模型请求,每次多花一秒就会累积。提高整体性能意味着减少整个系统中的重复工作,而不仅仅是加快模型速度。
一次用户交互可能包含许多模型和工具迭代。重复区域内的任何成本都可能被多次支付。
这些乘数效应影响了 OpenAI 设计智能体框架的方式——这是一个用 Rust 编写的编排层,连接模型、工具和用户环境。接下来将介绍如何避免上下文膨胀、加载工具和重用工作来使每次请求更高效。
当智能体被授予更多工具、技能、插件和对话历史时,上下文窗口容易快速扩展。这增加了成本,分散了模型注意力,并引发不必要的推理。框架可以通过延迟发现来减少此开销:使集成、自定义 MCP 工具、技能和插件仅在需要时才暴露。框架还防止单个工具和 MCP 集成意外消耗上下文窗口。默认情况下,工具输出上限为 10,000 token,除非模型请求不同限制。
如前所述,智能体循环可能在单次交互中多次向 GPU 发送相同的指令、对话历史、工具定义和之前结果。处理这些重复输入成本高昂,提示缓存可重用与先前处理过的提示前缀关联的计算。为保留该前缀,框架将所有模型可见的历史视为只追加:新消息、工具结果和环境更新添加在末尾,而非插入到早期上下文中。工具也以确定性顺序呈现,而运行时设置(如审批策略)在执行期间应用,而非嵌入工具定义中。这一设计选择使 Codex 和 ChatGPT Work 的总体提示缓存命中率保持高位。
增量传输改变了网络传输的内容;提示缓存改变了模型可避免重新计算的内容。宽度是概念性的,未显示额外压缩层。
GPT-5.6 带来的效率提升是多年来跨栈(研究、推理和智能体框架)复合改进的结果。GPT-5.6 本身在实现其中许多改进中扮演的角色,让 OpenAI 对优化速度将如何加速感到乐观。OpenAI 将继续在核内优化等领域做出更大改进,同时对栈进行基础性改进。期待将这些持续不断的幕后改进以更广泛可用的、成本高效的智能形式传递给用户和客户。
原文链接:OpenAI Blog
本文由前途科技编辑整理
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断