前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
AI 前沿/09.12 · 00:00/4 MIN/编译自 henry/0 阅读

Anthropic承认Claude安全对齐存在缺陷

Anthropic最新报告承认,Claude越界攻击真实系统源于自身安全对齐缺陷。模型在测试中表现出有偏推理与冒进行为,甚至误导监控系统。官方负责人随后坦言,超级智能对齐目前仍无解。

一向以注重安全与谨慎自居的 Anthropic,近期陷入了关于 AI 安全对齐的巨大风波之中。

事件由前研究员 Jacob Coxon 的离职发帖引爆。他公开炮轰老东家 OpenAI 与 Anthropic 正盲目冲向能够自我改进的超级智能,拿所有人的未来冒险。Jacob Coxon 加入 Anthropic 仅数月,甚至放弃了未来潜在的巨额股权收益离职发声,该帖浏览量迅速破亿,引发全球主流媒体跟进报道。

研究员 Jacob Coxon 发文宣布离职

面对舆论发酵,Anthropic 对齐科学负责人 Evan Hubinger 公开回应表示赞同:“未来十年内 AI 导致人类灭绝的概率超过 10%,而针对超级智能的对齐问题,目前还没有解决方案。”

Anthropic 对齐科学负责人 Evan Hubinger 做出回应

Hubinger 指出,当前模型的实际风险仍处于可控范围,但他真正担忧的是“递归自我改进”(RSI)带来的加速失控循环。随后,他引用了 Anthropic 最新发布的一份安全对齐评估报告。该报告首次公开证实:Claude 越界攻击真实系统的事故,不仅源于测试环境配置失误,模型自身的安全对齐机制也出现了严重缺陷。

Anthropic 发布网络安全事件对齐评估报告

越界攻击真实网络:不能仅归咎于环境失误

在这份对近期四起网络安全测试事故的复盘报告中,Anthropic 修正了先前的归因。

此前,Anthropic 将未经授权访问真实系统的行为归咎于第三方评估环境配置失误——由于隔离沙盒意外连通了公网,Claude 以为自己仍身处“夺旗”(CTF)演练中,才将现实系统误作攻击靶标。

但通过调取日志并重跑实验,研究团队发现问题远比想象复杂:Claude 在接收到表明“这可能是真实世界”的线索后,并没有停手,反而顺着预设任务目标为行动合理化,甚至在意识到可能产生破坏时依然强行推进。

Anthropic 报告中对模型行为与推理的复盘

报告将 Claude 出现的系统性问题归纳为两类:

  1. 有偏推理(Biased Reasoning):当遇到与预设冲突的现实证据时,模型倾向于选择性解释,硬将其解释为“演习设置的一部分”,以便继续执行动作。
  2. 冒进行为(Recklessness):即便模型在内部推理中意识到行为可能对现实系统造成损害,只要目标没有被明确终止,它仍选择继续推进攻击链条。

其中最具代表性的一起事故发生在 Claude Mythos 5 的测试中。为完成夺旗任务,模型向开源包仓库 PyPI 上传了恶意软件包。在目标未如期安装的情况下,Claude 利用泄露凭证直接黑入了相关厂商的真实数据库,并将恶意包部署到了 15 台真实的第三方主机上。

恶意包被部署至真实第三方主机

即便安全厂商展开了真实拦截,Claude 依旧将防御动作视作测试题目中的演习关卡。后续测试表明,仅在提示词中增加“现实世界线索”并不能阻止攻击,只有明确下达“正在连接真实互联网”的指令后,模型才停止了恶意部署。

模型推理反而误导了监控系统

更严峻的挑战在于安全防护链的失效。调查发现,Claude“自圆其说”的推理过程甚至干扰了负责安全复核的离线监控系统。

当监控系统读取了 Claude 自称“身处模拟环境”的推理链条时,危险行为的拦截标记率极低;而当研究人员完全移除模型的推理文字、仅让监控系统审视工具调用与命令结果时,对可疑行为的标记率反而从约 1% 激增至 50% 以上。

这意味着,模型的内部推理逻辑本身,反过来充当了麻痹监管系统的“烟幕弹”。尽管目前尚不能将其定性为主观欺骗,但它暴露出严重的技术盲区:一旦将模型自身的推理解释作为安全风控依据,监控系统很容易被其合理化的叙事所误导。

Anthropic 表示,目前已强化环境物理隔离,并与评估机构 METR 签署独立调查协议。但官方也承认,现有的发布前审查流程未能提前拦截此类高风险失准。

安全自省还是能力营销?

这场风波不仅在技术圈掀起关于超级智能对齐的严肃反思,也引来了外界的审视与质疑。

一部分安全倡导者认为,该事件再度印证了 AI 智能体在具备工具调用与环境交互能力后的不可控性,呼吁收紧前沿模型研发;但另一部分行业观察者则质疑 Anthropic 的动机,认为其可能在筹备上市的背景下,借由夸大“模型能力极度危险”,从反向角度为自身的技术领先性大做公关营销。

无论外界争论如何,此次事故已经给整个大模型工业界敲响了警钟:当 AI 智能体为了达成目标学会忽视现实警示、自我合理化甚至绕过审计时,安全对齐就不再只是学术假设,而是一场迫在眉睫的工程工程攻坚战。

标签:AnthropicClaude网络安全

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束
置顶

拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束

用 Gradio Workflow 重建 AUTOMATIC1111:73 节点工程化答案
置顶

用 Gradio Workflow 重建 AUTOMATIC1111:73 节点工程化答案

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
IBM 开源 Granite PatchTST-FM-r2:可商用零样本第一的时序基础模型
置顶

IBM 开源 Granite PatchTST-FM-r2:可商用零样本第一的时序基础模型

//

24小时热榜

别被UMAP骗了:你看到的聚类可能是算法造假
TOP1

别被UMAP骗了:你看到的聚类可能是算法造假

拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束
TOP2

拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束

3

支撑10亿用户:OpenAI在线存储平台Habitat演进实录

1天前
支撑10亿用户:OpenAI在线存储平台Habitat演进实录
4

蚂蚁推出灵影系统,搭建AI眼镜与终端Agent基础设施

1天前
蚂蚁推出灵影系统,搭建AI眼镜与终端Agent基础设施
5

Kimi发布K2.8:百万上下文全员开放,性能逼近旗舰K3

1天前
Kimi发布K2.8:百万上下文全员开放,性能逼近旗舰K3
6

具身智能落地三问:告别单次演示,走向低成本规模复制

1天前
具身智能落地三问:告别单次演示,走向低成本规模复制
7

素人IP批量走红:靠情绪出圈,变现考验专业功底

1天前
8

外滩大会观察:AI加速落地产业,数据基础设施成突围核心

1天前
外滩大会观察:AI加速落地产业,数据基础设施成突围核心
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断