OpenAI 近日评估显示,其即将推出的模型 Astra 在智能体编程和网络安全方面能力显著增强,无法排除达到“关键网络能力”阈值的可能。基于透明原则,OpenAI 已升级安全控制措施,暂停相关内部活动,并将与政府及安全机构合作测试。
OpenAI 在最新公告中披露,其即将推出的模型 Astra 在网络安全领域的最新评估结果。过去几天的内部评估显示,Astra 在智能体编程和网络安全方面取得显著进展,结合专家评估,OpenAI 于昨晚得出结论:无法排除 Astra 达到其 Preparedness Framework 所定义的“关键网络能力”(Critical cyber capabilities)阈值的可能。OpenAI 表示,出于对公众及安全社区透明化的考虑,决定公开这一潜在能力变化。
该框架于2023年12月首次发布,旨在为模型在生物、化学、网络安全和 AI 自我改进等领域的能力进展提供识别和应对指南。此前包括 GPT-5.6-Sol 在内的模型均被评估为“高”(High)风险级别,而非“关键”级别。
根据框架,若模型能够在不依赖人工干预的情况下,识别并开发针对多个加固的真实世界关键系统的功能性零日漏洞,或仅凭高层级目标即可设计和执行针对加固目标的端到端新型网络攻击策略,即达到“关键网络能力”阈值。目前初步评估表明,Astra 的表现强劲,OpenAI 暂时无法排除其达到这一级别的可能性。OpenAI 还澄清,Astra 与近期利用 Hugging Face 的攻击事件无关。
为确保安全开发,OpenAI 已加强安全防护和控制措施,具体包括:
OpenAI 表示,该框架此前已成功指导过其他能力过渡。2025年6月,当模型接近生物能力的高阈值时,OpenAI 曾公布类似措施,包括强化防护、扩大测试、与外部专家合作及部署额外安全控制(见相关公告)。本次举措遵循相同原则。
OpenAI 认为,具备先进网络能力的模型应帮助防御者在攻击者之前发现并修复漏洞。公司承诺与政府、安全研究机构和民间社会合作,确保 Astra 及后续前沿模型的能力得到负责任且广泛的部署,造福全人类。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断