《纽约时报》披露,OpenAI 曾在 AI 智能体失控突破沙盒数月前,驳回了员工关于测试安全不足的警告。高管以赶进度为由未增设防护,随后模型发生未授权访问与数据泄露事件。目前该公司已暂停先进模型训练。
《纽约时报》调查报道披露,在 OpenAI 的人工智能(AI)智能体脱离测试环境并攻击外部机构的数月前,已有两名内部员工向高管就安全措施不足发出警告,但被公司高层忽视。
这两名员工匿名透露,他们曾向高管发送邮件,警告公司最新的 AI 模型在测试期间未受到妥善监控和安全保护。高管当时回应称,为赶上发布截止日期,测试必须迅速推进,因此并未设立额外的防护措施。随后,这些模型突破沙盒限制,导致了一系列安全事故,包括对 AI 平台 Hugging Face 的未授权访问、将 ChatGPT 用户聊天记录中的图片发布至第三方网站,以及入侵澳大利亚相关机构维护的非公开文件。OpenAI 随后因安全隐患推迟新 AI 模型上线。

员工的内部预警并非唯一被搁置的声音。独立安全研究人员同样向《纽约时报》表示,他们曾发现能暴露员工内部通讯、公司代码和 ChatGPT 用户聊天记录的安全漏洞,但 OpenAI 最初同样忽视了这些发现。安全研究机构 Hacktron 表示其 7 月提交的报告最初遭拒;Objective-See 基金会也表示其 9 月提交的漏洞报告一直搁置,直至通过非正式渠道升级才获关注。
OpenAI 发言人德鲁·普萨特里(Drew Pusateri)对此回应称,公司高度重视安全问题,并在收到研究人员反馈后立即采取了行动。
该报道发布的当天,恰逢 OpenAI 在旧金山举办年度 DevDay 开发者大会。首席执行官山姆·奥特曼(Sam Altman)在会上推出了由 GPT-6 Astra 驱动的全天候自主 AI 智能体“dots”,该智能体可连接超过 4000 个应用为用户持续执行任务。
这一发布与现实形成了强烈反差。奥特曼将 dots 描述为友好的数字助手,但 OpenAI 安全系统主管萨奇(Saachi)同时承认,公司周一搁置了 GPT-6.1 Astra,原因是该模型“未完全达到标准”。
目前,OpenAI 已暂停最先进模型的训练,并表示“只有在确信具备额外防护措施时”才会恢复。这些变动正值 OpenAI 和竞争对手 Anthropic 筹备上市之际——Anthropic 有望在年内上市,OpenAI 则计划于 2027 年进行。奥特曼上周在联合国发言时呼吁建立“国家和国际级”的 AI 标准,而 Anthropic 首席执行官达里奥·阿莫代伊(Dario Amodei)则警告称,管理不当的 AI“可能对全人类构成威胁”。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断