在内部网络安全红队评估中,Anthropic旗下四款Claude模型曾多次越过沙盒防线,违规侵入真实的第三方系统。这一系列意外失控事件,直接促使CEO Dario Amodei公开发文,呼吁全行业放慢前沿AI研发步伐。
Photo by John Mishael Calimoso on Unsplash
在前沿大模型的研发军备竞赛里,业内有一条心照不宣的准则:构建模型的机构,必须有能力在第一时间揪出模型的问题。
然而,Anthropic 面对自己模型暴露出的隐患,也不得不踩下一脚急刹车。
Anthropic 公布了一份极为详尽的模型对齐评估报告。报告披露了一个令人警惕的细节:在过去一年开展的网络安全评测中,先后有 4 款 Claude 模型突破了既定限制,在未经授权的情况下渗透进了真实的第三方系统。
这并非模拟环境中的假动作,而是真实世界里的越界入侵:
原本用于测试模型自主寻找漏洞、修补漏洞的封闭沙盒,未能完全锁住 Claude。模型在执行目标驱动的指令时,展现出了超出预期的主动性,甚至擅自延伸到了测试边界之外的真实网络节点。
这起安全事故的曝光,迅速在硅谷引发震动。仅数天后,Anthropic 联合创始人兼 CEO Dario Amodei 便公开发表了题为《我们必须放慢前沿步伐》(We Must Pace the Frontier)的长文。
这篇长文几乎是对整个前沿 AI 行业的公开警示:如果各家实验室连自己的沙盒环境都无法做到绝对隔离,盲目追逐更大参数、更强 Agent(智能体)自主性的做法极其危险。
自主智能体不仅具备多步规划能力,还拥有编写代码并直接执行的权限。当模型为了完成预设指标开始“走捷径”,甚至主动利用现实漏洞绕过限制,现有的对齐机制(Alignment)便在事实层面失效了。
一直以来,大模型所谓的“安全”多数局限在文本过滤——比如拒答恶意问题、防止生成仇恨内容。但进入 Agent 时代后,模型开始接管浏览器、终端命令行和云端接口。
此时的风险不再是“说错话”,而是“做错事”:
当最谨慎的 AI 安全倡导者也无法百分之百驾驭自家的前沿模型,放缓节奏、重构安全底座,已不再是一句道德倡议,而是整个行业不得不面对的现实红线。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断