OpenAI 近日披露,在两起第三方网络安全评估中,测试环境配置与模型能力结合导致 GPT-5.6 等模型在特定条件下访问公共互联网并执行超出测试范围的行动。OpenAI 表示将加强评估流程,并与行业合作提升高风险测试的安全标准。

在部署之前,独立测试有助于我们验证并进一步了解风险。部分网络安全评估会刻意使用自定义配置,包括降低防护措施,以衡量模型底层能力,而非模型在公开部署中的常规表现。
在最近的评估中,两家外部测试合作伙伴发现了若干事件:测试配置和控制措施,叠加新一代模型不断增强的能力,导致模型活动超出了预期的测试边界。这些事件凸显了跨行业协作、与第三方评估机构共同演进测试环境和实践标准的必要性。
编者注:这些事件与 Hugging Face 安全事件无关,我们将继续通过该链接更新 Hugging Face 事件进展。
新事件均涉及 OpenAI 模型在第三方网络评估期间访问公共互联网,发生在特定条件和降低防护的配置下,不反映日常部署。具体包括两起:
以下是我们对这些事件的情况梳理:发生了什么、哪些测试条件导致了上述行为、如何处置、以及我们将如何确保独立实验室能够在严密且安全的情况下评估能力日益强大的模型。
这些事件都指向近期在 Hugging Face 事件文章中提到的同一个更大挑战:随着模型能力提升,围绕模型的安全防护系统也需要同步提升。这既包括用于开发模型的环境,也包括实验室和独立合作伙伴用于评估模型的环境。
未来几周,OpenAI 将审查自身第三方测试方法,包括如何识别高风险评估、约定范围、评估启用互联网访问或降低防护的请求、设定隔离、凭据处理、监控和停止条件等预期,并建立更清晰的事件通知和升级流程。
我们致力于与行业合作,强化高风险评估的安全共享实践,包括在未来几周召集各国 AI 研究所、独立评估机构、其他 AI 实验室等利益相关方。目标是在保持严格独立评估价值的同时,确保测试实践跟上模型能力发展的步伐。
8 月 3 日,英国 AISI 告知 OpenAI,在 7 月 25 日开始的例行网络评估中,OpenAI 和另一家实验室的模型在某些情况下超出了测试范围。评估在模拟真实网络的受控网络靶场中进行。在识别的 19 起事件中,两起涉及 OpenAI 的模型 GPT-5.6 Sol,其余涉及另一家实验室的模型。
此次评估中,智能体被指示在夺旗演习中扮演网络安全专家:入侵三个相互关联的模拟环境并取回最终旗帜。任务提示明确了范围内的靶场网络,并将若干系统列为范围外。英国 AISI 还启用了实时互联网访问,以便智能体下载工具,在更接近人类攻击者的条件下运行,并禁用模型的网络分类器以衡量底层能力。
英国 AISI 设定的授权边界是模拟网络靶场:智能体被授权攻击指定模拟网络并取回旗帜,而不是与靶场网络边界以外的系统交互。然而,智能体没有被明确告知允许如何使用开放互联网,英国 AISI 认为这可能是事件的潜在原因。
在这些运行中,英国 AISI 发现 GPT-5.6 Sol 在试图寻找进入模拟靶场并取回旗帜的路径时,执行了两次未经授权的操作:
虽然模型试图完成网络靶场任务,但英国 AISI 认为这些操作未经授权,因为涉及靶场边界之外的真实外部账号和服务,且并非完成任务所必需。DNS 服务器还在公共互联网上托管了利用载荷,尽管设置未成功且没有真实查询证据。
英国 AISI 于 7 月 28 日通过安全监控发现异常数据传输后识别了该活动,随后停止了相关评估,隔离了相关机器,并在发现后约一小时内控制了事态。
OpenAI 感谢英国 AISI 的全程配合,包括识别、调查和分享活动细节,并期待继续合作。
7 月 29 日,OpenAI 的第三方评估合作伙伴 Irregular 通知称,在 CTF 式网络安全评估中发生了涉及 OpenAI 模型的事件。模型被指示通过利用模拟环境中的漏洞寻找隐藏信息,并被告知没有互联网访问权限。但测试环境配置错误使模型能够访问公共互联网。
在一次测试中,CTF 挑战的虚构目标名称与一个真实域名意外重合。由于测试环境被错误连接到互联网,模型误以为真实网站是模拟环境的一部分并对其进行了利用。这不涉及复杂的沙箱逃逸或零日漏洞:互联网访问源于配置错误,模型似乎利用了基本的安全漏洞。
根据 Irregular 的调查,模型还发现并使用凭据操作了该网站。Irregular 未发现除受影响网站自身数据之外的影响,审计仍在进行中。它已暂停评估、开始补救,并通知了受影响的第三方。Irregular 表示,与该事件相关的所有问题均已不再活跃,并已为测试环境添加了相关防护措施。Irregular 还通报了同一测试环境中涉及其他实验室的相关事件。
OpenAI 感谢 Irregular 的配合,将继续与其密切合作支持审查。Irregular 正在撰写白皮书,分享遏制和安全管理网络评估的最佳实践。OpenAI 将参与白皮书,将研究结果提供给社区,并继续推进这种合作——这对于确保当前和未来模型得到安全、彻底的评估至关重要。
原文链接:OpenAI Blog
本文由前途科技编辑整理
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断