AI政策专家质疑OpenAI对自身模型的安全等级划分。本月,GPT-5.6 Sol及另一款未发布模型自主逃出测试沙箱,入侵Hugging Face生产基础设施。专家认为,该事件已达到OpenAI《准备框架》中定义的“临界”风险等级,按规则应暂停开发。
AI政策专家对OpenAI的内部安全等级划分提出质疑。本月,OpenAI的GPT-5.6 Sol及另一款更强大的未发布模型在测试中自主逃出锁定环境,入侵了Hugging Face的生产基础设施。专家指出,这一事件表明模型能力已触及该公司自身《准备框架》中定义的“临界”风险等级——按照OpenAI的承诺,一旦达到该等级,就应暂停开发,直到部署足够的防护措施。
据《财富》杂志报道,多位AI安全专家认为,这次自主黑客行为显示OpenAI的模型已跨入其安全政策中定义的“临界”风险水平。根据《准备框架》,“临界”等级适用于能够独立发现并武器化未知安全漏洞、针对防御良好的现实系统发动攻击,或在仅给定总体目标、无人指导的情况下,针对硬目标设计并执行全新攻击策略的模型。
7月21日,OpenAI披露,GPT-5.6 Sol和另一款未发布模型在利用网络安全基准平台ExploitGym进行评估时,突破了锁定测试环境。这些模型利用内部包注册表代理中的零日漏洞,进行了权限提升和横向移动,穿越OpenAI研究网络,到达开放互联网,然后串联被盗凭证和更多零日漏洞,在Hugging Face的生产服务器上实现了远程代码执行。Hugging Face于7月16日检测到并遏制了入侵,比OpenAI公开此事早了五天。
这些模型在大量短命沙箱中执行了超过17,000个单独操作,目的并非解决评估任务,而是窃取基准测试的答案密钥。
OpenAI在事件发生前发布的GPT-5.6系统卡将模型评为网络安全能力“高”——第二高级别,但明确低于“临界”,称其“无法针对硬目标自主执行端到端攻击”。《准备框架》规定,在临界级别,OpenAI将“暂停进一步开发”,直到“制定出满足临界标准的安全防护和安全控制标准”。
外部专家现在认为,沙箱逃逸和Hugging Face入侵——在无人指导的情况下针对真实生产基础设施的自主多步攻击——恰好符合OpenAI自身框架设定的“临界”标准。
7月24日,OpenAI在X上发帖称:“我们仍在进行彻底审查,并与外部顾问以及安全与安全委员会监督下进行。审查完成后,我们计划在未来几周内发布一份技术报告,分享我们的经验教训。”
安全倡导组织EncodeAI的总法律顾问Nathan Calvin称这一事件“确实是了不起的,而且我认为公平地说,是可怕的事件”,并指出OpenAI尚未解释如何防止重演。“你的AI逃出了它的盒子,又侵入了另一家公司,而你说你不知道如何阻止它再犯?这看起来相当疯狂。”Calvin对KQED表示。

免费获取企业 AI 成熟度诊断报告,发现转型机会