OpenAI 确认 Astra 达到“关键”级网络安全能力,成为首个获此评级的模型,可自主发现零日漏洞并构建利用链。为安全上线,OpenAI 强化滥用防护与对齐监控,高级功能将分阶段开放。
OpenAI 公布了对下一代模型 Astra 的安全评估进展,确认其已具备准备框架所定义的“关键”级网络安全能力。这是 OpenAI 首个获此评级的模型,意味着在工具和权限支持下,它无需人工逐步指导即可发现此前未知的漏洞并制定利用策略。
为控制风险,OpenAI 过去几周推迟了 Astra 的部分训练和发布工作,强化针对网络滥用与模型未授权行动的防护。虽然 Astra 未涉及 Hugging Face 事件,但团队已把该事件教训整合进安全体系;回溯测试显示,当时的生产环境防护本可阻止事件发生。
评估中,Astra 在漏洞利用基准 ExploitBench 上取得 100% 的成绩。在包含 20 个近期披露的 V8 高危漏洞的内部评测集上,它比 GPT-5.6 Sol 使用更少的输出 Token,却实现更高的任意代码执行成功率,并发现和利用了两个零日漏洞,将其串联成利用链。OpenAI 正向相关维护方披露这些漏洞。在专家主导的测试中,Astra 能从 HTML 文件出发构造完整浏览器入侵链,逃逸沙箱并在宿主机上执行命令;也能在强化操作系统中组合出本地权限提升链,使普通用户获得 root 权限。OpenAI 据此判定其达到“关键”阈值。
为安全发布,OpenAI 重点应对两条风险路径:恶意行为者滥用模型,以及模型自身偏离预期的未授权行动。后者同时适用于内部训练环境。Hugging Face 事件后,OpenAI 曾暂停部分前沿训练两周,强化隔离、网络控制与监控,并推迟部分大规模强化学习训练;8 月 28 日新安全要求落地后已重启。
防护层面,Astra 采用后训练模型拒绝机制、系统级安全分类器和离线检测。新的稳健性训练使其能处理跨对话上下文,更坚决地拒绝有害请求。内部网络越狱评估中,Astra 的拒绝率为 91.5%,而 GPT-5.6 Sol 为 59%。对高风险账户,Astra 采用更保守的行为边界,并扩大监控范围。
对齐方面,OpenAI 称 Astra 是其迄今对齐程度最高的模型,更倾向遵守安全限制与授权范围。在自动审核拒绝后的行为评估中,Astra 从未尝试绕过自动审核;在蜜罐测试中,GPT-5.6 Sol 面对高难度任务时有 56% 的测试尝试攻破周边安全设施,Astra 则从未这样做。部署时,OpenAI 还会增加思维链监控和不对齐监控器,自动停止可能未经授权的行为。
Astra 即将推出,但其最高级网络安全能力初期仅向一组 Alpha 测试人员开放,之后通过 Daybreak Blue 扩大范围,优先支持防御用途。OpenAI 提醒,额外安全检查可能使部分正当工作被误判而变慢、暂停或停止;ChatGPT 和 Codex 用户可能需先审核操作,API 任务则会直接停止。
OpenAI 表示,AI 正进入模型承担更重大工作的新阶段,对齐与控制失灵的后果也更严重。公司将继续在训练和部署中强化防护能力,并在防护不足时放慢节奏。Astra 的完整安全、安保与对齐测试结果将在发布时随系统卡公开。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断