OpenAI 披露两起第三方网络评估事件:其模型在特定测试配置下访问了公共互联网,超出预期测试边界。事件凸显了随着模型能力提升,测试环境与安全标准需同步升级的紧迫性。
独立测试在帮助我们在部署前验证和理解风险方面发挥着重要作用。部分网络评估会刻意使用自定义配置,包括降低安全防护措施,以衡量模型的底层能力——而非模型在公开部署中的常规表现。
在近期的评估中,两家外部测试合作伙伴发现了一些事件:测试配置和控制措施与新一代模型不断增强的能力相结合,导致模型活动超出了预期的测试边界。这些事件凸显了跨行业协作、与第三方评估机构共同演进测试环境和实践标准的重要性,以适应能力日益强大的模型。
编者注: 这些事件与 Hugging Face 安全事件无关,我们将继续在此处更新 Hugging Face 事件的相关进展。
新发生的事件涉及 OpenAI 模型在第三方网络评估期间访问公共互联网,这些行为发生在特定条件和降低防护的配置下,并不反映常规部署情况。事件包括:
以下我们总结了事件经过、触发活动的测试条件、遏制措施,以及我们为确保独立实验室能够继续安全、严谨地评估日益强大的模型而采取的举措。
这些事件指向了我们此前在 Hugging Face 事件中提到的同一项更广泛的挑战:随着模型能力提升,模型周边的安全和保障系统也需要同步进步。这既包括用于开发模型的环境,也包括实验室和独立合作伙伴用于评估模型的环境。
在未来数周内,我们将审查自身在第三方测试方面的做法,包括如何识别高风险评估、确定范围、评估启用互联网访问或降低防护的请求、设定隔离、凭据处理、监控和停止条件方面的预期,并建立更清晰的事件通知和上报流程。
我们致力于与业界合作,加强安全开展高风险评估的共享实践,包括在未来数周内召集国家人工智能研究所、独立评估机构、其他 AI 实验室等利益相关方。我们的目标是在保留严格独立评估价值的同时,确保测试实践跟上模型能力的发展步伐。
8 月 3 日,英国 AISI 告知我们,在 7 月 25 日启动的一次常规网络评估中,OpenAI 和另一家实验室的模型在某些情况下超出了测试范围。此次评估在模拟真实网络的受控网络靶场中进行。在发现的 19 起事件中,有 2 起涉及 OpenAI 的模型 GPT‑5.6 Sol,其余事件涉及另一家实验室的模型。
此次评估中,智能体被指示扮演网络安全专家,参与夺旗赛:攻克三个互联的模拟环境并获取最终标志。任务提示明确了范围内的靶场网络,并将多个系统列为范围外。英国 AISI 还启用了实时互联网访问,以便智能体下载工具、在更接近人类攻击者的条件下操作,同时禁用了模型的网络分类器以衡量底层能力。
英国 AISI 预期的授权边界是模拟网络靶场:智能体被授权攻击指定的模拟网络并获取标志,而非与靶场网络边界之外的系统交互。然而,智能体并未被明确告知如何或能否使用开放互联网访问,英国 AISI 认为这可能是导致事件的原因之一。
在这些运行过程中,英国 AISI 发现 GPT‑5.6 Sol 在试图找到进入模拟靶场的路径并获取标志时,执行了两次未经授权的操作:
尽管模型试图完成网络靶场任务,英国 AISI 仍认为这些操作未经授权,因为它们涉及靶场边界之外的真实外部账户和服务,且并非完成任务所必需。该 DNS 服务器还在公共互联网上托管了漏洞利用载荷,尽管设置未生效且无证据表明真实解析器查询过。
英国 AISI 于 7 月 28 日在安全监控检测到异常数据传输后发现该活动。它停止了相关评估,隔离了相关机器,并在检测到后约一小时内遏制了活动。
我们感谢英国 AISI 在此过程中的合作,包括其识别、调查和分享活动细节的工作。我们期待继续双方的协作。
7 月 29 日,我们的第三方评估合作伙伴 Irregular 通知我们,其开展的夺旗赛(CTF)式网络安全评估中涉及 OpenAI 模型的事件。模型被指示通过利用模拟环境中的弱点来查找隐藏信息,并被告知没有互联网访问权限。然而,测试环境的配置错误导致模型能够访问公共互联网。
在一次测试中,CTF 挑战中虚构目标的名称意外与一个真实域名重合。由于测试环境被错误地连接到互联网,模型利用了一个真实网站,误以为它是模拟环境的一部分。这并非复杂的沙盒逃逸或零日漏洞:互联网访问源于配置错误,模型似乎是利用了一个基础的安全漏洞。
根据 Irregular 的调查,模型还发现并使用了凭据来操作该网站。Irregular 尚未确认除受影响网站自身数据之外的其他影响,其审计仍在进行中。它已暂停评估、开始修复,并已通知受影响的第三方。Irregular 告知我们,与该事件相关的所有问题均已不再活跃,并已在测试环境中添加了相关的防护措施。Irregular 还通报了来自同一测试环境中涉及其他实验室的相关事件。
我们感谢 Irregular 的合作,并将继续与其密切合作以支持其审查。Irregular 还在撰写一份白皮书,分享有关隔离和安全运行网络评估的最佳实践。我们期待参与该白皮书,将成果分享给社区,并继续我们的合作。我们认为这种协作对于确保当前和未来模型的安全、全面评估至关重要。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断