前途科技前途科技
  • 洞察
  • 服务
  • 关于
  • AI 资讯
    • 快讯
    • 产品
    • 技术
    • 商业
    • 政策
    • 初创
  • 洞察
  • 资源中心
    • 深度研究
      • AI 前沿
      • 案例研究
      • AI 知识库
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们

OpenAI撤回SWE-bench Pro推荐:三成任务存在缺陷

洞察2026年7月8日· 7 分钟阅读120 阅读

OpenAI对其推荐的编码基准SWE-bench Pro进行审计,发现约30%的任务存在测试过度严格、提示不明确等问题,导致评估结果失真。团队已撤回推荐,并呼吁社区关注评估质量,建设更可靠的基准测试。

准确评估模型能力是保障安全部署的关键决策基础。OpenAI 在每个模型发布时都会报告多项外部与内部基准结果,以追踪模型进步。但当评估本身存在缺陷时,可能误导对能力的理解,影响安全决策和研究方向。

此前,OpenAI 已指出 SWE-bench Verified 存在设计缺陷和数据污染,不再使用,并建议社区转向 SWE-bench Pro。SWE-bench Pro 由 Scale AI 设计,旨在通过更长期、更真实的编码任务衡量模型智能体能力。在 731 个公开任务中,前沿模型的通过率在 8 个月内从 23.3% 提升至 80.3%。

然而,OpenAI 最近对 SWE-bench Pro 进行了类似审计,使用数据点分析流水线检查模型尝试记录、任务元数据和失败轨迹,以标记可能的问题。被标记的任务经过多轮智能体审查和五位资深软件工程师的独立评估,分歧部分进一步调查。

结果发现大量任务存在缺陷:数据流水线标记了 200 个(27.4%)问题任务,人类审核则识别出 249 个(34.1%)。问题主要分为四类:

  • 测试过于严格:测试强制规定了提示中未指定的实现细节,导致许多功能正确的提交被判失败。
  • 提示不明确:任务描述遗漏了隐藏测试要求且无法合理推断的内容。
  • 测试覆盖不足:测试未充分检查所需功能,使不完整的修补方案也能通过。
  • 误导性提示:提示引导模型走向错误行为,或与测试要求矛盾。

这些发现表明,创建困难且公平的基准极具挑战,而智能体在规模化数据质量检查中正发挥更大作用。OpenAI 估计 SWE-bench Pro 约有 30% 的任务存在问题,建议模型开发者仔细审查结果。

审计方法包括:自动过滤器标记可能问题(共 286 个),然后通过人类监督的智能体审核和人工标注活动双重审查。智能体审核由 Codex 驱动的调查智能体访问仓库和环境,进行深度检查;人工标注则由经验丰富的软件工程师独立判断。人类比智能体更容易将任务标记为有缺陷,且倾向于多标签分类,表明多个问题共存。

讨论部分指出,开源仓库中的问题报告和拉取请求原本用于人类协作,描述、代码和测试之间往往不一致,导致难以形成干净的评估任务。同时,随着模型能力提升,利用模型本身来检查评估质量变得可行。

OpenAI 希望评估社区能开发由经验开发者专门为测试模型能力而构建的基准,保留高难度和真实性,并允许更好的人工监督。鉴于本次分析中发现的问题,OpenAI 撤回此前采纳 SWE-bench Pro 的建议。

最终,一项评估应提供有意义的信号:难以作弊、易于信任、真正反映模型能力或对齐。这些结果直接影响 OpenAI 的部署与安全决策,因此依赖的评估必须有效且有信息量。

标签:OpenAISWE-bench Pro代码生成

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

//

24小时热榜

五角大楼发布第四批UFO解密文件
TOP1

五角大楼发布第四批UFO解密文件

欧盟指控 Meta 社交平台采用成瘾设计
TOP2

欧盟指控 Meta 社交平台采用成瘾设计

3

Meta 上诉加州社交媒体成瘾判决

4小时前
Meta 上诉加州社交媒体成瘾判决
4

马斯克要求特斯拉员工改用Grok AI模型

8小时前
马斯克要求特斯拉员工改用Grok AI模型
5

英国将微软谷歌等列为金融系统关键服务商

8小时前
英国将微软谷歌等列为金融系统关键服务商
6

腾讯领衔财团,20亿美元回购Manus

8小时前
腾讯领衔财团,20亿美元回购Manus
7

ChatGPT Work 发布:AI 智能体帮你搞定复杂工作

16小时前
ChatGPT Work 发布:AI 智能体帮你搞定复杂工作
8

GPT-2注意力计算:权重定视线,值定信息

8小时前
GPT-2注意力计算:权重定视线,值定信息
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款