Anthropic发布针对智谱GLM-5.3的安全评估报告,指出该开源模型具备极强的软硬件漏洞挖掘与端到端攻击链构建能力。然而详实的测试数据和低成本攻击实测,反而被业内视为对GLM-5.3前沿能力的有力背书。
Anthropic 近日发布了一份针对智谱 GLM-5.3 的安全评估报告。报告称,GLM-5.3 展现出极高水平的软件漏洞挖掘与利用能力,且防滥用机制容易被绕过,呼吁行业警惕相关网络安全风险。
然而,报告中详尽的实测数据与复现过程,反而让不少业内人士戏称这篇警告“成了给智谱打的最佳广告”。

为了佐证 GLM-5.3 的潜在威胁,Anthropic 列出了一系列具体的基准测试数据与实测案例:

Anthropic 在报告中指出的另一核心问题是安全护栏的脆弱性。尽管原版 GLM-5.3 会默认拒绝直接的恶意攻击请求,但在角色扮演提示(如伪装成“红队演练 AI 智能体”)或预填思考流程的引导下,越狱成功率大幅提升。
此外,针对开源权重模型常见的权重修改技术(Abliteration),Anthropic 团队耗费约 2200 GPU 小时(约 4400 美元算力)成功移除了其拒答机制。移除护栏后,GLM-5.3 在 JailbreakBench 和 HarmBench 等安全基准上的拒答率从 90% 以上降至个位数,而推理和编程能力几乎未受损。

Anthropic 借此呼吁对具备高危能力的模型开展第三方独立评估,并强调闭源限制与受信访问机制在当前阶段的必要性。
值得注意的是,去除安全对齐的 Abliteration 针对的是所有开放权重模型,并非 GLM-5.3 独有。数据显示,原版 GLM-5.3 在常规有害请求上的拒答率约 95%,与 Claude 的 96% 相差无几。
开源模型赋予了开发者和防御方自主部署与深度分析的自由,但也带来了权重一旦释出便无法撤回的安全挑战。Anthropic 的详细测试不仅揭示了 AI 在网络安全攻防中的质变,也从侧面印证了中国头部开源模型在复杂推理与系统级任务上的快速演进。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断