OpenAI 发布 GPT-5.6 系列模型,重新定义性价比:以极低成本提供前沿级智能体性能,并带来持久化推理、多智能体编排等新 API 能力,帮助开发者显著降低构建成本。
GPT-5.6 系列模型重新定义了价格与性能的平衡,让前沿级智能体能力变得大幅亲民,同时也在拓展能力上限。
本指南展示创业公司如何通过更聪明的模型选择和新的 API 控制(推理连续性、多智能体编排、程序化工具调用),以更低的成本构建更快、更强的智能体。
自 GPT-5 以来,每一代模型都致力于用更少的 token 处理更长周期的任务。GPT-5.6 延续了这一趋势:更强的智能体表现、更低的成本,且基础架构几乎不变。
在效率提升的基础上,低推理档位的准确性也更高了。例如,在 Agents' Last Exam 基准上,使用相同 harness,GPT-5.6 Sol 的“低”推理档表现超过了 GPT-5.5 的“高”档。创业公司在生产测试中也报告,通过降低推理强度,在多种工作流中获得了显著的成本改善。
过去,长周期任务的最佳选择一直是最高推理档位的旗舰模型,因为它们在长上下文和工具调用上的能力远超成本优化模型。但 5.6 系列改变了这一点:借助更多测试时计算,Luna 和 Terra 在不少场景下表现接近 GPT-5.4 和 5.5,成本却低得多。
以 BrowseComp 基准为例:三个月前,GPT-5.5(Extra High)得分 84.36%,总成本 33.27 美元;而发布时的 GPT-5.6 Luna(Extra High)得分 84.04%,成本仅 1.33 美元。此后价格又进一步下调。查看最新降价详情。
5.6 系列中较小的模型非常适合高吞吐量、低延迟和智能体流程中的重复步骤。比如,法律科技初创公司在做智能体分析前,可以用 Terra 或 Luna 解析手写备忘录,而不必全程调用前沿模型,大幅节省成本。
除了开箱即用的性能提升,OpenAI 还为 Responses API 增加了新原语,带来三个互补的架构干预,让智能体更高效:
组合使用效果显著。例如在 ARC-AGI-3 基准上,GPT-5.6 Sol 用标准 harness 得分为 13.3%;启用保留推理和压缩后,得分跃升至 38.3%,而输出 token 减少了约 6 倍。模型未变,性能却提升了近两倍。详见ARC-AGI-3 harness 调查。
智能体工作流通常包含两类任务:需要判断的任务,以及主要是移动、过滤和合并数据的任务。
当智能体检索 100 份文件、按日期过滤并找出相关交易时,模型不必在上下文窗口内推理每一个中间结果。程序化工具调用让 GPT-5.6 编写 JavaScript 来编排工具、并行执行独立调用,并在上下文窗口外处理输出。这样,模型只专注于真正需要智能的部分——判断。
对于复杂且可并行的任务,将动作和推理分布到多个智能体工作流中,能加快任务完成速度,也带来更高的智能水平。在这种架构中,主智能体负责编排子智能体并分配任务,子智能体并行推进目标,最后将输出交回主智能体进行综合。
开发者可以在 Responses API 中启用多智能体来原生使用这一能力。ChatGPT 的“超能力”设置也是同样原理。
虽然 GPT-5.6 能较好地把控子智能体的数量和启动时机,但多智能体行为高度可引导。通过指令明确何时调用子智能体,可以确保只在额外 token 投入能换来更好表现时才创建子智能体。
整个模型家族的提示缓存 TTL 已延长至至少 30 分钟,并且可以在模型上下文窗口内确定性地设置缓存断点,帮助创业公司显著提高缓存命中率。
除了设置缓存断点,继续使用合适的 prompt_cache_key 也能提高请求命中同一推理引擎的概率,从而降低延迟。
这些例子最突出的一点是,构建智能体的经济性已经彻底改变。
过去每个环节都需要前沿模型的任务,现在通过更小的模型、调优推理强度和高效的架构选择,就能以几分之一的成本获得相当甚至更好的结果。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断