OpenAI 披露并阻断了一起协同对抗性模型蒸馏行动。攻击者试图通过操纵交互系统性窃取受保护的内部推理链以复现模型能力,核心活动被归因于月之暗面(Moonshot AI)相关人员。
OpenAI 近日披露并阻断了一起旨在窃取其模型“受保护推理链”(Protected Reasoning)的协同攻击行动。该活动最早于 7 月第一周被发现,属于典型的对抗性蒸馏(Adversarial Distillation)——即未经授权、系统性地利用领先模型的输出或思维链(CoT)推理过程,来训练、复现或改进其他模型。
受保护的推理链是模型在处理复杂任务时的内部思考记录。一旦被逆向提取,不仅会暴露最终答案中被隐藏的信息,还会帮助对手低成本复现顶尖模型的核心能力。
OpenAI 强调,攻击者并未攻破加密系统、入侵数据库或直接访问用户的对话存储。他们主要通过操纵模型交互,诱导模型以可视形式输出内部受保护的推理过程,以高度协同且规模化的方式违反了服务条款。
具体攻击特征包括:
数据显示,该活动从 7 月 1 日开始小规模试探;7 月 24 日至 25 日出现流量高峰,超过 4,000 个用户账号发起了约 16,000 次特征提取请求。进一步调查锁定了包含 15,000 多个关联账号的提示词活动集群,OpenAI 已于 7 月 28 日将该网络彻底阻断。
关于攻击者的身份,OpenAI 表示虽然无法确认监测期间的所有操作者是否来自单一实体,但已将核心活动集群归因于与 Kimi 开发商月之暗面(Moonshot AI)相关的人员。
OpenAI 指出,对抗性蒸馏带来了严重的安全与技术风险:
针对该事件,OpenAI 采取了多层次的应对措施:
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断