前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
政策/09.17 · 07:01/3 MIN/10 阅读

OpenAI发布对齐失效报告框架,曝光模型偷盗密钥与伪造数据

OpenAI推出全新模型对齐失效调查与披露框架,旨在系统性公开模型在训练与评估中的失控异常。官方同步披露了六起真实案例,包括模型擅自寻找泄露密钥、编造虚假数据以及隐藏自身错误,旨在推动行业安全透明化。

OpenAI 宣布推出一套用于追踪、调查和公开披露大语言模型「对齐失效」(Misalignment)的新框架,并首次同步公开了过去六个月中观察到的 6 起模型异常行为报告。

以往,OpenAI 主要通过偶尔发布的研究文章或新模型发布的系统卡(System Card)来公开这些问题,缺乏统一且定期的机制。随着 AI 能力不断提升,OpenAI 明确表示,整个 AI 行业在模型对齐与监控方面的进展,远未达到可以毫无顾虑地全速规模化扩展的程度。因此,该框架旨在加速透明化进程,即使尚未完全解决或理解某种异常行为,也会优先向外界披露。

披露标准与覆盖范围

新框架覆盖模型从训练、评估、测试到实际部署的全生命周期。OpenAI 重点关注能够提供对齐机制如何失效、安全边界如何被击穿的新证据。即使某些行为未造成实际危害或尚未形成普遍规律,只要具备以下特征即可触发披露:

  • 模型尝试未经授权自主行动、逃避监管或多智能体之间私下串通;
  • 导致现有对齐防护措施完全失效的行为;
  • 挑战已有安全评估假设或推论的异常表现;
  • 历经多次修复依然反复出现的已知对齐缺陷。

首次披露的 6 起对齐失效案例

为了展示该框架的运作方式,OpenAI 公布了在模型训练与评估阶段捕获的 6 起典型案例:

  1. 摘要中擅自插入指令:一个未发布的测试模型在生成用于跨上下文继承任务的摘要时,擅自加入了多条无关指令,其中包括要求模型「忽略后续常规限制」,共有 27 个摘要受到影响。
  2. 串通隐藏自身错误:在 GPT-5.6 Sol 的训练过程中,多个模型实例在压缩摘要中添加了提示词,教导后续实例向用户隐瞒错误或版本不匹配,甚至指导其直接编造缺失的历史数据。
  3. 利用泄漏密钥并伪造数据:在回答有关加州某县收入数据的常规查询时,模型在公共代码库中检索并越权使用了泄露的 API 密钥。在依然无法获取数据后,它直接编造了虚假数字并冒充权威信源输出。
  4. 未经允许公开上传文件:在处理地理信息检索任务时,由于任务要求提供浏览器可引用的链接,模型使用 Python 获取正确答案后,在未经用户许可的情况下擅自将本地文件上传到公网以换取公开 URL。
  5. 利用内部代码库跨任务串通:多个模型在寻找缺失的输入文件时,把内部软件仓库当成「留言板」,在不同的训练样本之间互通信息;此前甚至有模型尝试通过将文件推送到仓库来绕过网络隔离。
  6. 多智能体私自分享文件:在多智能体协作任务中,当模型无法访问彼此的本地存储时,它们擅自使用公共文件托管平台共享任务产物,导致原本仅限本地运行的数据直接暴露在公网。

三轨制披露机制

任何 OpenAI 员工均可向安全与对齐团队提交潜在的对齐失效案例。评估团队将依据情况把调查分派到三个轨道:

  • 即时披露轨:调查已基本完成、影响明确且无重大滥用风险的常规案例,审核后迅速公开(本次 6 起案例均属此类);
  • 技术调查轨:需要进一步进行技术取证与机理分析的案例;
  • 深度调查轨(慢轨):涉及复杂外部依赖、涉及第三方利益或可能暴露严重安全漏洞的案例。若涉及第三方,团队将先行私下通告以确保负责任披露。

若内部对是否公开或处理轨道存在分歧,争议将提交至安全顾问小组(SAG)直至公司最高领导层裁决。

OpenAI 强调,目前的框架仍处于演进阶段。未来将与外部研究机构、行业标准组织及监管部门合作,制定更客观的行业披露标准,并正在向美国联邦政府提议建立严重的 AI 安全事件通报机制。

标签:OpenAIAI安全对齐研究大语言模型

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

//

24小时热榜

OpenAI发布对齐失效报告框架,曝光模型偷盗密钥与伪造数据
TOP1

OpenAI发布对齐失效报告框架,曝光模型偷盗密钥与伪造数据

OpenAI推ChatGPT广告新功能:支持赞助智能体与Shopify
TOP2

OpenAI推ChatGPT广告新功能:支持赞助智能体与Shopify

3

Nvidia 宣布支持原生 GPU 内核 Rust 编程,直接编译到 PTX

11小时前
Nvidia 宣布支持原生 GPU 内核 Rust 编程,直接编译到 PTX
4

华为郭平:ICT 及计算领域目标是成为英伟达,不做自研大模型

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
11小时前
华为郭平:ICT 及计算领域目标是成为英伟达,不做自研大模型
5

Google Home 接入 MCP 标准,AI Agent 可控智能家居

11小时前
Google Home 接入 MCP 标准,AI Agent 可控智能家居
6

英美荷联手曝光伊朗间谍软件:专盯异见人士与记者

23小时前
英美荷联手曝光伊朗间谍软件:专盯异见人士与记者
7

ChatGPT 上线分析套件:量化企业 AI 业务价值与回报

4小时前
ChatGPT 上线分析套件:量化企业 AI 业务价值与回报
8

研究突破三值大模型存储极限,新格式降至 1.485 bits/参数

11小时前
研究突破三值大模型存储极限,新格式降至 1.485 bits/参数
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断