OpenAI 在内部评估中发现,即将发布的 Astra 模型在自主编程和网络安全方面表现突出,可能达到其《准备框架》中定义的“关键”网络能力阈值。公司已加强安全管控,并暂停部分相关内部活动,同时将与政府及安全组织合作测试。

网络安全领域正在快速变化,模型的各项能力不断增强,既可能强化防御,也可能以前所未有的速度和规模发起攻击。
OpenAI 近日对即将推出的 Astra 模型进行了最新内部评估,结果显示其在自主编程和网络安全方面取得了显著进展。结合专家评估,OpenAI 在昨晚得出结论:按照《准备框架》的标准,目前无法排除该模型已具备关键网络攻击能力的可能性。
OpenAI 表示,之所以公开这一信息,是因为他们认为应当向公众以及安全社区保持透明度。
《准备框架》最初于 2023 年 12 月发布,当时模型尚未在生物、化学、网络安全和 AI 自我改进等方面接近当前水平。该框架用于识别能力进展,并规划后续应对措施。此前包括 GPT-5.6-Sol 在内的模型,都被评估为“高”风险阈值,而非“关键”。
根据《准备框架》的定义,若模型能够在无人干预的情况下,识别并开发出针对多个加固真实关键系统的、各种严重程度的可用零日漏洞,或者仅凭一个高层次目标,就能设计并执行针对加固目标的端到端新型攻击策略,即达到“关键”网络安全阈值。
虽然评估仍在继续,但初步结果显示 Astra 的表现足够强,OpenAI 目前无法排除其达到关键能力等级的可能性。需要说明的是,Astra 是即将发布的模型,与 Hugging Face 遭遇攻击的事件无关。
为此,OpenAI 已加强针对安全防护和管控措施的鲁棒性测试,以适应这些能力的部署。在内部,OpenAI 也采取了以下措施,确保模型的后续开发安全可靠:
《准备框架》此前已帮助 OpenAI 度过了其他能力转折点。2025 年 6 月,当模型接近生物学领域的高能力阈值时,OpenAI 曾概述了加强防护、扩大测试、与外部专家合作以及部署额外安全控制的措施。此次同样遵循这一原则。
OpenAI 相信,具备先进网络能力的模型应帮助防御者赶在攻击者之前发现并修复漏洞。OpenAI 表示,将与政府、安全机构和民间社会共同努力,确保 Astra 及后续模型的尖端能力得到负责任且广泛的部署,惠及全人类。
原文链接:OpenAI Blog
本文由前途科技编辑整理
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断