前途科技前途科技
  • 洞察
  • 服务
  • 关于
  • AI 资讯
    • 快讯
    • 产品
    • 技术
    • 商业
    • 政策
    • 初创
  • 洞察
  • 资源中心
    • 深度研究
      • AI 前沿
      • 案例研究
      • AI 知识库
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们

GPT-5.6 开发者指南:性价比新标杆

AI 前沿2026年8月12日· 原作者:OpenAI Blog· 5 分钟阅读0 阅读

OpenAI 发布 GPT-5.6 模型家族,以更低成本实现前沿级智能体表现。响应 API 新增推理持久化、多智能体编排与程序化工具调用,帮助开发者用更少预算构建更强大的 AI 智能体。

GPT-5.6 开发者指南:性价比新标杆

GPT-5.6 模型家族让前沿级智能体性能变得大幅更便宜,同时将能力边界向前推进。本文介绍初创公司如何通过更聪明的模型选择,以及响应 API 新增的推理连续性、多智能体编排和程序化工具调用控制,以更低成本构建更快、更强的智能体。

开箱即用的体验更好了

自 GPT-5 以来,每一代模型都致力于用更少的 token 处理更长周期的任务。GPT-5.6 延续了这一方向:更强的智能体性能、更低的成本,底层测试框架几乎不用改变。

性价比提升不仅体现在总成本上,还体现在低推理强度下的准确率提高。例如在 Agents' Last Exam 基准上,使用相同测试框架,GPT-5.6 Sol 在“低”推理强度下的表现超过了 GPT-5.5 在“高”推理强度下的表现。一些初创公司在生产测试中也发现,把推理强度从原来的默认值调低后,多个工作流的成本都显著下降。

模型选择

过去,长周期任务的最佳选择一直是最高推理强度的旗舰模型,因为它们在处理长上下文和工具调用时远强于成本优化模型。GPT-5.6 家族改变了这一局面:有了更多 test-time compute,Luna 和 Terra 在多数情况下能达到接近 GPT-5.4 和 5.5 的效果,同时便宜得多。

以 BrowseComp 基准为例,这个搜索类基准测试模型查找冷门事实的能力。三个月前,GPT-5.5(Extra High)在该基准上得分 84.36%,总成本 33.27 美元。而 GPT-5.6 Luna(Extra High)在发布时达到几乎相同的性能——84.04%,成本仅 1.33 美元。此后 OpenAI 又进一步降价。了解最新降价详情。

5.6 家族的小模型适合高吞吐量、低延迟场景,以及智能体工作流中的重复步骤。例如,一家法律科技初创公司需要先解析手写备忘录再做智能体分析,现在可以改用 Terra 或 Luna 做提取,而不是全程使用前沿模型,从而节省大量成本。

用 Responses API 构建更高效的智能体

除提升模型本身性能外,OpenAI 还向 Responses API 增加了新的原语。GPT-5.6 采用端到端训练,内置三种互补的架构干预手段:

  1. 复用已完成的工作:允许推理结果跨轮次持久化,并使用原生压缩来压缩长对话,让模型在更长任务周期中保持连贯,不必每次都重建上下文。
  2. 并行分解任务:通过原生多智能体编排,协调多个智能体并行工作,更快完成复杂任务。
  3. 把确定性工作下沉到代码:用程序化工具调用在模型上下文窗口之外过滤、聚合和编排工具输出,让模型 token 只用于判断,从而降低成本、延迟和上下文腐化。

组合使用效果显著。例如在 ARC-AGI-3 上,GPT-5.6 Sol 用标准测试框架得分 13.3%;开启推理持久化和压缩后,得分跃升至 38.3%,同时输出 token 减少了约 6 倍。模型没有变,性能却接近原来的三倍。详见 ARC-AGI-3 测试框架调查。

程序化工具调用

智能体工作流通常包含两类任务:需要判断的任务,以及主要是移动、过滤、合并数据的任务。当智能体检索 100 份文件、按日期过滤并找出相关交易时,模型不应在上下文窗口中对每个中间结果进行推理。程序化工具调用让 GPT-5.6 可以编写 JavaScript 来编排工具、并行执行独立调用、在上下文窗口外处理输出,模型只需专注于真正需要智能的部分:判断。

多智能体

在复杂且可并行化的任务上,将推理和行动分配到多个智能体工作流中,可以加快任务完成速度并提升整体智能水平。在这种架构中,主智能体负责编排子智能体并分配任务,子智能体并行完成目标后,将结果传回主智能体做最终综合。团队现在可以在 Responses API 中启用多智能体,ChatGPT 的“超强”能力设置也是这么工作的。

虽然 GPT-5.6 对何时创建子智能体、创建多少个有很强的直觉,多智能体行为也是可引导的。告诉模型何时该调用子智能体,可以确保只有在额外 token 能带来更好性能时才会生成子智能体。

提示词缓存

整个模型家族的提示词缓存 TTL 已延长到至少 30 分钟,并且现在可以在模型的上下文窗口内确定性设置缓存断点。这帮助初创公司显著提高了缓存命中率。

除了设置缓存断点,使用合适的 prompt_cache_key 也能增加请求命中同一推理引擎的概率,从而降低延迟。

结语

这些例子说明,构建智能体的经济学已经改变。过去每个步骤都要用前沿模型的任务,现在通过使用更小的模型、调节推理强度、做合理的架构选择,就能以几分之一的成本获得相当甚至更好的结果。


原文链接:OpenAI Blog
本文由前途科技编辑整理

标签:GPT-5.6OpenAI智能体API推理

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

会打字,就能"拍"电影:ScriptTask 开放限量内测
置顶

会打字,就能"拍"电影:ScriptTask 开放限量内测

//

24小时热榜

GPT-5.6 开发者指南:更低成本,更强智能体
TOP1

GPT-5.6 开发者指南:更低成本,更强智能体

OpenAI推Ultrafast模式:GPT-5.6 Sol提速14倍
前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
TOP2

OpenAI推Ultrafast模式:GPT-5.6 Sol提速14倍

3

OpenAI 任命 Dali Rajic 为首席营收官

2小时前
OpenAI 任命 Dali Rajic 为首席营收官
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断