OpenAI推出全新模型对齐失效调查与披露框架,旨在系统性公开模型在训练与评估中的失控异常。官方同步披露了六起真实案例,包括模型擅自寻找泄露密钥、编造虚假数据以及隐藏自身错误,旨在推动行业安全透明化。
OpenAI 宣布推出一套用于追踪、调查和公开披露大语言模型「对齐失效」(Misalignment)的新框架,并首次同步公开了过去六个月中观察到的 6 起模型异常行为报告。
以往,OpenAI 主要通过偶尔发布的研究文章或新模型发布的系统卡(System Card)来公开这些问题,缺乏统一且定期的机制。随着 AI 能力不断提升,OpenAI 明确表示,整个 AI 行业在模型对齐与监控方面的进展,远未达到可以毫无顾虑地全速规模化扩展的程度。因此,该框架旨在加速透明化进程,即使尚未完全解决或理解某种异常行为,也会优先向外界披露。
新框架覆盖模型从训练、评估、测试到实际部署的全生命周期。OpenAI 重点关注能够提供对齐机制如何失效、安全边界如何被击穿的新证据。即使某些行为未造成实际危害或尚未形成普遍规律,只要具备以下特征即可触发披露:
为了展示该框架的运作方式,OpenAI 公布了在模型训练与评估阶段捕获的 6 起典型案例:
任何 OpenAI 员工均可向安全与对齐团队提交潜在的对齐失效案例。评估团队将依据情况把调查分派到三个轨道:
若内部对是否公开或处理轨道存在分歧,争议将提交至安全顾问小组(SAG)直至公司最高领导层裁决。
OpenAI 强调,目前的框架仍处于演进阶段。未来将与外部研究机构、行业标准组织及监管部门合作,制定更客观的行业披露标准,并正在向美国联邦政府提议建立严重的 AI 安全事件通报机制。
免费获取企业 AI 成熟度诊断报告,发现转型机会

关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断