OpenAI 发现,GPT-5.6 Sol 在 ARC-AGI-3 基准测试上分数低的原因并非模型本身,而是评估框架丢弃了推理过程并使用滚动截断。通过开启保留推理和压缩两个 API 设置,模型分数从 13.3% 飙升到 38.3%,输出 token 减少 6 倍,接近人类水平。
GPT‑5.6 Sol 曾解决过数学难题,击败过《宝可梦》游戏,但在 ARC-AGI-3 基准测试上却表现不佳,得分仅 7.8%,而 GPT‑5.5 更是只有 0.4%。是 2D 拼图游戏对模型特别难吗?还是另有原因?
OpenAI 发现,基准测试衡量的不仅是模型本身,还包括 API 设置、评估框架设计和提示词等隐性因素。对于 ARC-AGI-3,他们开启了两项在 ChatGPT 和 Codex 中使用的 API 设置——保留推理(retained reasoning)和压缩(compaction),结果分数提高了 3 倍,输出 token 减少了 6 倍。

ARC-AGI-3 用于衡量 AI 智能体的学习和推理能力。智能体需探索陌生 2D 游戏,推断其规则。你可以在这里试玩 25 个演示游戏。
该项目使用了一个通用的评估框架,没有特殊工具或功能,目的是暴露模型短板并公平比较。而商业开发者通常会针对模型特性优化框架。

Ethan Mollick 展示了 GPT‑5.6 Sol 在 Codex 中击败《杀戮尖塔2》随机每日挑战,该游戏发布时间晚于模型的知识截止日期。
深入调查后,OpenAI 发现模型的困惑并非自身问题,而是框架设置所致。
首先,每次游戏动作后,模型的私人推理(private reasoning)被丢弃。这导致模型每次都需要重新理解游戏,无法记住之前的思考过程。虽然能记录过往动作和简短注释,但无法看到背后的计划、洞察或想法。
其次,框架使用滚动截断窗口(rolling truncation window),历史记录变长后,早先动作变得不可见。模型既记不住之前的思考,也开始丢失对过往动作的记忆。
正是这两个因素——丢弃推理和滚动截断——解释了为什么模型难以随时间学习。
OpenAI 的模型在输出回复或工具调用前,会先通过私人推理消息进行思考,这些消息会保留在对话历史中。对话过长时,会进行摘要并继续。这是模型训练和部署(ChatGPT、Codex)的方式。
为了更贴近生产环境,OpenAI 用 Responses API 实现了 ARC-AGI-3 框架。该 API 让上下文管理变得简单:传递前一个 response ID 即可跨工具调用和消息保留推理。
开启保留推理后,出现两大变化:第一,模型每次动作前的思考时间减少,因为无需从头解读游戏;第二,能记住过往想法后,模型随时间学习的能力显著提升,策略更加连贯。
接下来,用压缩(compaction)替代滚动截断,又带来了改进。压缩是 Responses API 的另一设置。ARC-AGI-3 框架原本使用滚动截断处理上下文限制:当对话上下文超过 175,000 字符时,丢弃最早的消息。这种方法有两个缺点:模型丢失早期观察和动作,并且大部分时间在接近满容的上下文窗口中运行,影响性能。
启用压缩后,GPT‑5.6 Sol 能更好地保留所学内容,在更长运行中保持稳定,用更少的输出 token 获得更高分数。

结合保留推理和压缩,GPT‑5.6 Sol(max)的分数提升约 3 倍,输出 token 减少 6 倍。
这些实验提醒我们,基准测试很少孤立地衡量模型——它们还衡量 API 设置、框架设计和提示词等隐性选择。这并非首次出现类似情况:某个公开基准测试上模型分数偏低,而后发现评估框架使用了不保留推理消息的通用设置。
如果你是 API 开发者并希望最大化性能,建议使用与 OpenAI 产品相同的设置:
如果你在比较模型,建议使用上述设置的评估结果,因为它们更接近 ChatGPT 和 Codex 中的真实使用情况。
OpenAI 对 ARC 团队多年在 AGI 评估上的创造性工作以及促使他们深入研究的分析表示感谢。
原文链接:OpenAI Blog
本文由前途科技编辑整理
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断