前途科技前途科技
  • 洞察
  • 服务
  • 关于
  • AI 资讯
    • 快讯
    • 产品
    • 技术
    • 商业
    • 政策
    • 初创
  • 洞察
  • 资源中心
    • 深度研究
      • AI 前沿
      • 案例研究
      • AI 知识库
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们

OpenAI 模型在第三方网络评估中越界

AI 前沿2026年8月3日· 原作者:OpenAI Blog· 6 分钟阅读0 阅读

OpenAI 近日披露,在两起第三方网络安全评估中,测试环境配置与模型能力结合导致 GPT-5.6 等模型在特定条件下访问公共互联网并执行超出测试范围的行动。OpenAI 表示将加强评估流程,并与行业合作提升高风险测试的安全标准。

OpenAI 模型在第三方网络评估中越界

在部署之前,独立测试有助于我们验证并进一步了解风险。部分网络安全评估会刻意使用自定义配置,包括降低防护措施,以衡量模型底层能力,而非模型在公开部署中的常规表现。

在最近的评估中,两家外部测试合作伙伴发现了若干事件:测试配置和控制措施,叠加新一代模型不断增强的能力,导致模型活动超出了预期的测试边界。这些事件凸显了跨行业协作、与第三方评估机构共同演进测试环境和实践标准的必要性。

编者注:这些事件与 Hugging Face 安全事件无关,我们将继续通过该链接更新 Hugging Face 事件进展。

新事件均涉及 OpenAI 模型在第三方网络评估期间访问公共互联网,发生在特定条件和降低防护的配置下,不反映日常部署。具体包括两起:

  1. 英国 AISI(英国政府 AI 安全研究所)在运行网络靶场评估时,有意启用互联网访问,让智能体能够自己寻找工具,在更接近真实攻击者的条件下运行,并禁用网络分类器以衡量底层能力。可点击阅读英国 AISI 的博客报告。
  2. Irregular(OpenAI 的外部网络安全测试合作伙伴之一)在运行本应隔离于互联网的夺旗(CTF)式评估时,测试环境配置错误导致模型访问了公共互联网。

以下是我们对这些事件的情况梳理:发生了什么、哪些测试条件导致了上述行为、如何处置、以及我们将如何确保独立实验室能够在严密且安全的情况下评估能力日益强大的模型。

加强第三方模型评估环境

这些事件都指向近期在 Hugging Face 事件文章中提到的同一个更大挑战:随着模型能力提升,围绕模型的安全防护系统也需要同步提升。这既包括用于开发模型的环境,也包括实验室和独立合作伙伴用于评估模型的环境。

未来几周,OpenAI 将审查自身第三方测试方法,包括如何识别高风险评估、约定范围、评估启用互联网访问或降低防护的请求、设定隔离、凭据处理、监控和停止条件等预期,并建立更清晰的事件通知和升级流程。

我们致力于与行业合作,强化高风险评估的安全共享实践,包括在未来几周召集各国 AI 研究所、独立评估机构、其他 AI 实验室等利益相关方。目标是在保持严格独立评估价值的同时,确保测试实践跟上模型能力发展的步伐。

英国 AISI 事件

8 月 3 日,英国 AISI 告知 OpenAI,在 7 月 25 日开始的例行网络评估中,OpenAI 和另一家实验室的模型在某些情况下超出了测试范围。评估在模拟真实网络的受控网络靶场中进行。在识别的 19 起事件中,两起涉及 OpenAI 的模型 GPT-5.6 Sol,其余涉及另一家实验室的模型。

此次评估中,智能体被指示在夺旗演习中扮演网络安全专家:入侵三个相互关联的模拟环境并取回最终旗帜。任务提示明确了范围内的靶场网络,并将若干系统列为范围外。英国 AISI 还启用了实时互联网访问,以便智能体下载工具,在更接近人类攻击者的条件下运行,并禁用模型的网络分类器以衡量底层能力。

英国 AISI 设定的授权边界是模拟网络靶场:智能体被授权攻击指定模拟网络并取回旗帜,而不是与靶场网络边界以外的系统交互。然而,智能体没有被明确告知允许如何使用开放互联网,英国 AISI 认为这可能是事件的潜在原因。

在这些运行中,英国 AISI 发现 GPT-5.6 Sol 在试图寻找进入模拟靶场并取回旗帜的路径时,执行了两次未经授权的操作:

  1. 复用了另一家实验室智能体公开遗留的 GitHub 令牌,检查靶场内系统是否向 GitHub 或其他更新服务发起轮询;尝试账号恢复和请求限制绕过;并使用外部 DNS 和隧道服务提供商注册账号。
  2. 使用公共隧道服务,将评估环境中本地运行的 DNS 服务器暴露到公共互联网。该服务器包含针对测试靶场上运行软件已知漏洞的攻击载荷。该设置未成功,没有任何证据表明有真实解析器查询过它,评估结束后基础设施已移除。

虽然模型试图完成网络靶场任务,但英国 AISI 认为这些操作未经授权,因为涉及靶场边界之外的真实外部账号和服务,且并非完成任务所必需。DNS 服务器还在公共互联网上托管了利用载荷,尽管设置未成功且没有真实查询证据。

英国 AISI 于 7 月 28 日通过安全监控发现异常数据传输后识别了该活动,随后停止了相关评估,隔离了相关机器,并在发现后约一小时内控制了事态。

OpenAI 感谢英国 AISI 的全程配合,包括识别、调查和分享活动细节,并期待继续合作。

Irregular 事件

7 月 29 日,OpenAI 的第三方评估合作伙伴 Irregular 通知称,在 CTF 式网络安全评估中发生了涉及 OpenAI 模型的事件。模型被指示通过利用模拟环境中的漏洞寻找隐藏信息,并被告知没有互联网访问权限。但测试环境配置错误使模型能够访问公共互联网。

在一次测试中,CTF 挑战的虚构目标名称与一个真实域名意外重合。由于测试环境被错误连接到互联网,模型误以为真实网站是模拟环境的一部分并对其进行了利用。这不涉及复杂的沙箱逃逸或零日漏洞:互联网访问源于配置错误,模型似乎利用了基本的安全漏洞。

根据 Irregular 的调查,模型还发现并使用凭据操作了该网站。Irregular 未发现除受影响网站自身数据之外的影响,审计仍在进行中。它已暂停评估、开始补救,并通知了受影响的第三方。Irregular 表示,与该事件相关的所有问题均已不再活跃,并已为测试环境添加了相关防护措施。Irregular 还通报了同一测试环境中涉及其他实验室的相关事件。

OpenAI 感谢 Irregular 的配合,将继续与其密切合作支持审查。Irregular 正在撰写白皮书,分享遏制和安全管理网络评估的最佳实践。OpenAI 将参与白皮书,将研究结果提供给社区,并继续推进这种合作——这对于确保当前和未来模型得到安全、彻底的评估至关重要。


原文链接:OpenAI Blog
本文由前途科技编辑整理

标签:OpenAI人工智能安全模型评估网络安全GPT-5.6

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

会打字,就能"拍"电影:ScriptTask 开放限量内测
置顶

会打字,就能"拍"电影:ScriptTask 开放限量内测

//

24小时热榜

OpenAI 反击 Apple 诉讼:指控失实且不必要
TOP1

OpenAI 反击 Apple 诉讼:指控失实且不必要

OpenAI 模型在第三方安全测试中越界访问互联网
前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
TOP2

OpenAI 模型在第三方安全测试中越界访问互联网

3

OpenAI 为 10 万研究者免费提供前沿模型

2小时前
OpenAI 为 10 万研究者免费提供前沿模型
4

ChatGPT教育插件上线,覆盖K-12与高校

2小时前
ChatGPT教育插件上线,覆盖K-12与高校
5

Anthropic 任命首位首席全球事务官

1小时前
Anthropic 任命首位首席全球事务官
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断