OpenAI发现,在ARC-AGI-3基准测试中,启用保留推理和压缩两项API设置,使GPT-5.6 Sol的得分从13.3%提升至38.3%,输出token减少6倍。这一发现揭示了基准测试中隐藏的设置影响,为AI评估提供了重要参考。
GPT-5.6 Sol在数学难题和游戏挑战中表现出色,但在ARC-AGI-3——一个二维谜题游戏基准测试中,得分仅为7.8%,而GPT-5.5更是只有0.4%。这是否意味着模型存在先天不足?
深入分析后发现,问题并非出在模型本身,而是基准测试的API设置。在官方测试工具中,每次行动后模型的私有推理过程被丢弃,导致模型无法利用之前的思考成果。同时,采用滚动截断机制,随着历史增长,较早的行动记录也会丢失。这两个设置使得模型无法有效学习。
ARC-AGI-3旨在评估AI智能体的学习与推理能力,其测试工具设计简洁,但商业开发者通常会针对模型特性优化工具。OpenAI在ChatGPT和Codex中部署模型时,会保留推理消息并使用压缩技术处理上下文。当在ARC-AGI-3测试中启用这些设置后,GPT-5.6 Sol的得分从13.3%升至38.3%,输出token缩减至原先的1/6。
具体而言,保留推理让模型每次行动前无需重新理解游戏,节省了思考时间,并基于记忆形成连贯策略。压缩技术则避免了滚动截断导致的早期信息丢失,使模型在更长任务中保持学习效果。两者结合显著提升了性能。
OpenAI建议API开发者采用与自身产品相同的设置:使用Responses API、保留推理、启用压缩。同时,评测者应采用更贴近实际应用场景的设置来比较模型性能。这一发现提醒我们,基准测试的结果不仅反映模型能力,也受API设置、测试工具设计等隐性因素影响。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断