OpenAI推出GPT-5.6模型家族,包含Sol、Terra、Luna三款。旗舰Sol性能超越Claude Fable 5,成本减半;Terra持平GPT-5.5,价格减半;Luna最便宜。通过推理和智能体框架的深度优化,实现了前沿智能与极致效率的结合。
OpenAI 发布 GPT-5.6 模型家族,旨在平衡能力与成本。旗舰模型 Sol 在 Artificial Analysis Coding Agent Index 上超越 Claude Fable 5,但成本不到一半;Terra 性能与 GPT-5.5 相当,价格减半;Luna 是最快最便宜的模型,价格比 Sol 低 80%。这些效率提升来自对模型、推理和智能体框架的全面优化。
过去四年,OpenAI 用户达 10 亿、企业超 200 万,效率成为关键。GPT-5.6 通过训练实现每 token 完成更多工作,优化任务成功率和效率。
在算力受限、需求增长快于供给的背景下,推理栈的效率至关重要。目标是用相同硬件服务更多 token,同时保持智能、延迟、可用性和可靠性。优化涵盖路由、调度、内核、缓存和模型实现。GPT-5.6 Sol 在 Codex 中发挥了关键作用。
负载均衡:根据地理、容量、加速器类型路由请求;在集群内根据负载、上下文长度、缓存可用性等分配工作;在实例内跨加速器和子网络高效分配。Sol 帮助分析生产流量、发现不平衡源头、测试新策略,大幅降低了服务成本。
内核优化:Sol 自动重写和优化生产内核,使用 OpenAI 维护的开源 GPU 编程语言 Triton 和 Gluon,使端到端服务成本降低 20%。同时使用验证工具 FpSan 确保正确性。
推测解码:运行小型草案模型与主模型并行,提出多个 token 供主模型验证。Sol 通过数百次实验改进草案模型架构,并自主监控训练过程,使 token 生成效率提升超过 15%。
KV 缓存:输入时构建 KV 缓存,输出时重复读取和扩展。Sol 分析生产负载,生成并评估候选配置,实现特定工作负载的优化,从相同硬件中获得更多推理能力。
推理优化是一个持续反馈循环,Sol 加速了每个环节。
ChatGPT Work 和 Codex 通过一系列模型请求和工具调用来完成任务。智能体框架(Rust 编排层)通过减少重复工作提高效率。
避免上下文膨胀:通过延迟发现,只在需要时加载集成、自定义 MCP 工具、技能和插件;工具输出默认限制 10000 token,防止占用上下文。
保留精确前缀用于提示缓存:代理循环中重复发送相同指令、历史等。框架将历史视为只追加,新内容加在末尾;工具按确定顺序呈现,运行时设置在执行时应用,提高了提示缓存命中率。
效率增益来自多年堆栈优化,包括研究、推理和智能体框架。Sol 在优化中发挥的作用让人对未来的加速感到乐观。OpenAI 将继续在核优化和基础堆栈方面做出更大改进,将成本高效的智能带给用户。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断