OpenAI 近日披露并拦截了一起有组织的对抗性模型蒸馏行动。攻击者试图通过提示词漏洞提取受保护的内部推理数据,涉及超 1.5 万名用户。OpenAI 指出部分核心活动与月之暗面关联人员有关。
OpenAI 近日披露并阻断了一起有组织的「对抗性模型蒸馏」行动。攻击者未经授权,试图系统性地从 OpenAI 模型中提取受保护的内部推理内容(Reasoning Content),以此训练、复现或改进其他模型。
受保护的推理内容是模型在生成最终回答前记录的思考过程。这类内容若被提取,不仅会泄露未公开的中间信息,还能帮助第三方低成本复现前沿模型的核心能力。
调查显示,攻击者并未入侵数据库或破解加密体系,而是利用交互提示词与跨对话机制实施攻击:操作者将一段对话中加密的推理数据复制到另一段对话中,诱导模型对其进行解密与转录,使隐藏内容在前端重现。
此前,独立安全研究人员已通过负责任的漏洞披露流程向 OpenAI 报告了类似的跨模型与对话压缩漏洞,协助验证了相关攻击路径。
根据 OpenAI 监测数据:
OpenAI 评估认为,虽然无法确认所有参与者均属同一主体,但其中一组核心活动是由与 Kimi 开发商**月之暗面(Moonshot AI)**有关联的人员实施。
OpenAI 强调,对抗性蒸馏不仅关乎知识产权,还会带来安全与合规风险:
针对此类攻击,OpenAI 采取了多层防御措施:
OpenAI 表示,随着前沿模型推理能力的演进,对抗性蒸馏手法将持续升级。公司正持续强化工具端防御与分类器检测,推动云服务合作伙伴落实同等级别的安全管控。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断