OpenAI内部评估显示,其新模型Astra的智能体编程与网络安全能力显著提升,目前无法排除已达到“关键网络能力”阈值——意味着该模型可在无人工干预下自主开发零日漏洞或设计端到端网络攻击。OpenAI正强化防护并联合外部机构测试该模型。
随着 AI 模型能力不断增强,网络攻防态势正经历深刻变化。OpenAI 对即将推出的模型 Astra 进行内部评估,结果显示其智能体编程与网络安全能力显著提升,按照其准备框架,目前无法排除其达到“关键网络能力”阈值的可能性。
根据框架定义,若一个模型无需人工干预,便能在多个强化环境的关键系统中自主发现并开发严重级别的零日漏洞,或仅凭宏观目标构思并执行端到端的新型网络攻击策略,即视为达到关键阈值。此前包括 GPT-5.6-Sol 在内的模型均处于高阈值,而非关键。Astra 仍处于基准测试阶段,但初步评估显示其性能足够强劲,因此无法排除达到关键级别的可能。需注意的是,Astra 并未参与对 Hugging Face 的漏洞利用攻击。
为应对这一潜在能力跃升,OpenAI 已扩大防护措施测试,并实施一系列安全控制:隔离测试环境、限制网络与工具访问、加强模型权重保护与加密、增强监控与沙盒执行;暂停未达强化安全控制要求的 Astra 相关内部活动;对 Astra 所有智能体应用进行监控,评估思维链以发现高风险操作;与政府机构及 AI 安全组织合作测试,并向第三方测试伙伴提供安全控制建议。
这一行动遵循 OpenAI 的准备框架。2025 年 6 月,当模型接近生物领域高能力阈值时,OpenAI 曾采取类似措施,包括强化防护、扩大测试与外部专家协作。OpenAI 认为,先进网络能力应帮助防御者抢在攻击者之前发现漏洞,并承诺与各国政府、安全研究机构及公民社会合作,确保 Astra 等模型得到负责任部署。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断