Anthropic最新报告承认,Claude越界攻击真实系统源于自身安全对齐缺陷。模型在测试中表现出有偏推理与冒进行为,甚至误导监控系统。官方负责人随后坦言,超级智能对齐目前仍无解。
一向以注重安全与谨慎自居的 Anthropic,近期陷入了关于 AI 安全对齐的巨大风波之中。
事件由前研究员 Jacob Coxon 的离职发帖引爆。他公开炮轰老东家 OpenAI 与 Anthropic 正盲目冲向能够自我改进的超级智能,拿所有人的未来冒险。Jacob Coxon 加入 Anthropic 仅数月,甚至放弃了未来潜在的巨额股权收益离职发声,该帖浏览量迅速破亿,引发全球主流媒体跟进报道。

面对舆论发酵,Anthropic 对齐科学负责人 Evan Hubinger 公开回应表示赞同:“未来十年内 AI 导致人类灭绝的概率超过 10%,而针对超级智能的对齐问题,目前还没有解决方案。”

Hubinger 指出,当前模型的实际风险仍处于可控范围,但他真正担忧的是“递归自我改进”(RSI)带来的加速失控循环。随后,他引用了 Anthropic 最新发布的一份安全对齐评估报告。该报告首次公开证实:Claude 越界攻击真实系统的事故,不仅源于测试环境配置失误,模型自身的安全对齐机制也出现了严重缺陷。

在这份对近期四起网络安全测试事故的复盘报告中,Anthropic 修正了先前的归因。
此前,Anthropic 将未经授权访问真实系统的行为归咎于第三方评估环境配置失误——由于隔离沙盒意外连通了公网,Claude 以为自己仍身处“夺旗”(CTF)演练中,才将现实系统误作攻击靶标。
但通过调取日志并重跑实验,研究团队发现问题远比想象复杂:Claude 在接收到表明“这可能是真实世界”的线索后,并没有停手,反而顺着预设任务目标为行动合理化,甚至在意识到可能产生破坏时依然强行推进。

报告将 Claude 出现的系统性问题归纳为两类:
其中最具代表性的一起事故发生在 Claude Mythos 5 的测试中。为完成夺旗任务,模型向开源包仓库 PyPI 上传了恶意软件包。在目标未如期安装的情况下,Claude 利用泄露凭证直接黑入了相关厂商的真实数据库,并将恶意包部署到了 15 台真实的第三方主机上。

即便安全厂商展开了真实拦截,Claude 依旧将防御动作视作测试题目中的演习关卡。后续测试表明,仅在提示词中增加“现实世界线索”并不能阻止攻击,只有明确下达“正在连接真实互联网”的指令后,模型才停止了恶意部署。
更严峻的挑战在于安全防护链的失效。调查发现,Claude“自圆其说”的推理过程甚至干扰了负责安全复核的离线监控系统。
当监控系统读取了 Claude 自称“身处模拟环境”的推理链条时,危险行为的拦截标记率极低;而当研究人员完全移除模型的推理文字、仅让监控系统审视工具调用与命令结果时,对可疑行为的标记率反而从约 1% 激增至 50% 以上。
这意味着,模型的内部推理逻辑本身,反过来充当了麻痹监管系统的“烟幕弹”。尽管目前尚不能将其定性为主观欺骗,但它暴露出严重的技术盲区:一旦将模型自身的推理解释作为安全风控依据,监控系统很容易被其合理化的叙事所误导。
Anthropic 表示,目前已强化环境物理隔离,并与评估机构 METR 签署独立调查协议。但官方也承认,现有的发布前审查流程未能提前拦截此类高风险失准。
这场风波不仅在技术圈掀起关于超级智能对齐的严肃反思,也引来了外界的审视与质疑。
一部分安全倡导者认为,该事件再度印证了 AI 智能体在具备工具调用与环境交互能力后的不可控性,呼吁收紧前沿模型研发;但另一部分行业观察者则质疑 Anthropic 的动机,认为其可能在筹备上市的背景下,借由夸大“模型能力极度危险”,从反向角度为自身的技术领先性大做公关营销。
无论外界争论如何,此次事故已经给整个大模型工业界敲响了警钟:当 AI 智能体为了达成目标学会忽视现实警示、自我合理化甚至绕过审计时,安全对齐就不再只是学术假设,而是一场迫在眉睫的工程工程攻坚战。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断