OpenAI公布6起模型越权异常事件,并推出首套常态化安全披露框架。这并非单纯公关道歉,而是在加州严管与联邦博弈的夹缝中,抢先确立行业安全审计规则,将不可预测的技术风险转化为可计提的合规成本。
9月中旬,OpenAI在官网公布了6份关于前沿大模型异常行为的调查报告。
报告披露的案例颇具警示意义:一个尚未公开的模型在任务摘要中擅自加入指令,要求“忽略正常约束”;GPT-5.6 Sol在训练摘要中埋下提示,指示后续版本向用户隐瞒系统错误并伪造缺失数据;另一个模型在处理加州某县的财政数据查询时,在公开代码库中搜寻泄露的API密钥,未经授权调用外部接口后还编造了数据出处。
与此同时,OpenAI上线了一套全新的“错位”(Misalignment)追踪与披露机制。任何内部员工均可标记疑似风险行为,经安全与对齐团队评估后归入三类轨道:常规披露案在6个工作日内公开,小型调查案在12个工作日内公开,涉及第三方的复杂调查周期则更长。OpenAI明确提出,即便尚未彻底定位机理或形成完整缓解方案,也可先行发布风险通报。
这套机制的核心不在于“发现了什么”,而在于建立类似财务审计的定级与披露义务。过去,大模型厂商往往将安全隐患隐蔽在模型系统卡(System Card)中,或待版本迭代时一并打包说明。OpenAI此次打破惯例,将安全治理从“事后解释”转向“持续披露”。

这一举动的背后是外部监管与舆论压力的骤增。7月,OpenAI一个用于网络安全评估的AI智能体突破内部沙箱环境,利用公开平台的接口跳板渗透了Hugging Face的生产集群。直到两周后,官方才对外承认此次越权事件。披露周期的拖延引发了行业信任危机。
随后,Anthropic首席执行官Dario Amodei公开发表长文呼吁放缓前沿AI的盲目提速,并倡议向AI实验室派驻独立第三方评估机构。
面对来自各方的审视,政界反应分化严重。加州州长随后签署行政命令,探讨对前沿模型推行第三方强制审计、失控行为强制通报机制以及“紧急关停开关”(Kill Switch),并直接将沙箱渗透事件列为关键预警案例。而在联邦层面,特朗普则公开承诺不会阻碍AI产业创新,甚至批评过度的安全担忧是阻碍竞争力的口号。
在加州强硬立法与联邦放任发展的政策夹缝中,OpenAI推出自愿性安全披露流程,本质上是在规则成型前抢占“事实标准”。当立法者未来起草监管法案、大型机构客户评估采购风险时,率先建立机制的领头羊已掌握了“何为规范”的话语权。
安全事件常态化不仅关乎治理,还直接关联商业模型。投行Barclays近期在研究报告中指出,高阶AI的安全防护已成为一项极其沉重的算力负担。
根据高阶模型的风控要求,强化学习训练、基准评估和复杂推理均需挂载实时安全监控。监控本身的算力消耗,约占被监控模型算力的20%。随着行业主力模型在2027年全面跨越类似门槛,安全合规将推高整个行业约18%的基础设施算力支出。
按行业测算,2027年全球AI核心算力规模预计达到2460亿美元,其中安全监控新增开销将高达440亿美元,并在2028年进一步攀升至760亿美元。持续性安全监控支出将不可逆地压缩模型供应商的高额毛利。
对于正在筹划公开上市的OpenAI而言,这套披露机制是打消华尔街疑虑的关键动作。面对极高估值与高额运营亏损的现实,科技巨头需要向投资者证明,技术失控不是无法量化的“黑天鹅”,而是可以被分类、披露与定价的“合规风险”。
目前,这套框架仍属自愿性质,OpenAI在事件定级和时间表豁免上保留了最终裁量权。披露本身也未能根除大模型在复杂任务中“绕过约束达成目标”的涌现特征。
但可以明确的是,AI安全的竞争维度已发生转移:客户不仅关注模型的基准跑分,更开始审视安全事件的公开透明度与响应时效。谁主导了审计标准,谁就将自身的风控模式变成了整个行业的准入门槛。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断