OpenAI 发布 GPT-5.6 模型家族,以更低成本实现前沿级智能体表现。响应 API 新增推理持久化、多智能体编排与程序化工具调用,帮助开发者用更少预算构建更强大的 AI 智能体。

GPT-5.6 模型家族让前沿级智能体性能变得大幅更便宜,同时将能力边界向前推进。本文介绍初创公司如何通过更聪明的模型选择,以及响应 API 新增的推理连续性、多智能体编排和程序化工具调用控制,以更低成本构建更快、更强的智能体。
自 GPT-5 以来,每一代模型都致力于用更少的 token 处理更长周期的任务。GPT-5.6 延续了这一方向:更强的智能体性能、更低的成本,底层测试框架几乎不用改变。
性价比提升不仅体现在总成本上,还体现在低推理强度下的准确率提高。例如在 Agents' Last Exam 基准上,使用相同测试框架,GPT-5.6 Sol 在“低”推理强度下的表现超过了 GPT-5.5 在“高”推理强度下的表现。一些初创公司在生产测试中也发现,把推理强度从原来的默认值调低后,多个工作流的成本都显著下降。
过去,长周期任务的最佳选择一直是最高推理强度的旗舰模型,因为它们在处理长上下文和工具调用时远强于成本优化模型。GPT-5.6 家族改变了这一局面:有了更多 test-time compute,Luna 和 Terra 在多数情况下能达到接近 GPT-5.4 和 5.5 的效果,同时便宜得多。
以 BrowseComp 基准为例,这个搜索类基准测试模型查找冷门事实的能力。三个月前,GPT-5.5(Extra High)在该基准上得分 84.36%,总成本 33.27 美元。而 GPT-5.6 Luna(Extra High)在发布时达到几乎相同的性能——84.04%,成本仅 1.33 美元。此后 OpenAI 又进一步降价。了解最新降价详情。
5.6 家族的小模型适合高吞吐量、低延迟场景,以及智能体工作流中的重复步骤。例如,一家法律科技初创公司需要先解析手写备忘录再做智能体分析,现在可以改用 Terra 或 Luna 做提取,而不是全程使用前沿模型,从而节省大量成本。
除提升模型本身性能外,OpenAI 还向 Responses API 增加了新的原语。GPT-5.6 采用端到端训练,内置三种互补的架构干预手段:
组合使用效果显著。例如在 ARC-AGI-3 上,GPT-5.6 Sol 用标准测试框架得分 13.3%;开启推理持久化和压缩后,得分跃升至 38.3%,同时输出 token 减少了约 6 倍。模型没有变,性能却接近原来的三倍。详见 ARC-AGI-3 测试框架调查。
智能体工作流通常包含两类任务:需要判断的任务,以及主要是移动、过滤、合并数据的任务。当智能体检索 100 份文件、按日期过滤并找出相关交易时,模型不应在上下文窗口中对每个中间结果进行推理。程序化工具调用让 GPT-5.6 可以编写 JavaScript 来编排工具、并行执行独立调用、在上下文窗口外处理输出,模型只需专注于真正需要智能的部分:判断。
在复杂且可并行化的任务上,将推理和行动分配到多个智能体工作流中,可以加快任务完成速度并提升整体智能水平。在这种架构中,主智能体负责编排子智能体并分配任务,子智能体并行完成目标后,将结果传回主智能体做最终综合。团队现在可以在 Responses API 中启用多智能体,ChatGPT 的“超强”能力设置也是这么工作的。
虽然 GPT-5.6 对何时创建子智能体、创建多少个有很强的直觉,多智能体行为也是可引导的。告诉模型何时该调用子智能体,可以确保只有在额外 token 能带来更好性能时才会生成子智能体。
整个模型家族的提示词缓存 TTL 已延长到至少 30 分钟,并且现在可以在模型的上下文窗口内确定性设置缓存断点。这帮助初创公司显著提高了缓存命中率。
除了设置缓存断点,使用合适的 prompt_cache_key 也能增加请求命中同一推理引擎的概率,从而降低延迟。
这些例子说明,构建智能体的经济学已经改变。过去每个步骤都要用前沿模型的任务,现在通过使用更小的模型、调节推理强度、做合理的架构选择,就能以几分之一的成本获得相当甚至更好的结果。
原文链接:OpenAI Blog
本文由前途科技编辑整理
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断