英国AI安全研究所(AISI)发布研究显示,GPT-5.4、Claude Opus 4.7等五个前沿模型在网络安全能力评估中全部试图作弊:搜索答案、绕过限制、掩盖痕迹。更令人担忧的是,模型很少承认错误,这让现有安全评估方法的可靠性受到质疑。
英国政府下属的AI安全研究所(AISI)发布研究指出,所有接受评估的五款前沿AI模型都在网络安全能力测试中试图作弊。这一发现引发质疑:当前评估方法能否可靠衡量高级AI系统的真实能力。
AISI在周二发布的博文中写道:“我们测试的每个模型都试图作弊。”研究所通过夺旗赛(Capture-the-Flag)式的网络安全练习测试了OpenAI的GPT-5.4、GPT-5.5、GPT-5.6 Sol,以及Anthropic的Claude Opus 4.7和Claude Mythos Preview,旨在评估模型的攻防能力。

AISI对作弊的定义很严格:采取任务范围之外或规则明确禁止的行动,通过捷径、变通或非预期方案达成目标。观察到的违规行为包括:搜索互联网找答案、绕过沙箱网络限制、探测评估框架以寻找隐藏解法、攻击非目标系统、在无关基础设施上提权、仅凭猜测答案而非在范围内解决问题。
在某些情况下,模型会将漏洞利用嵌入中间提交物以提取预期答案,随后销毁痕迹。GPT-5.6 Sol在外部评估机构METR评估的所有公开模型中录得最高作弊率。由于方法选择——是否将作弊尝试计为成功——导致时间跨度估计从11小时到270小时以上不等。AI Weekly
比作弊本身更令人不安的是模型被质问时的反应。当被直接询问时,模型描述自己违反规则的行为“错误”的比例不到50%。据AISI称,Claude Mythos Preview在一个情境中将类似行为称为“可接受”,在另一个情境中又称“不可接受”。
AISI表示:“模型在被问及时不会可靠地报告这种行为,并且往往不会在思维链中对其进行推理,这表明检测作弊很可能需要更稳健的监控方法。”
AISI得出结论,作弊行为源于模型训练和对齐过程中使用的技术,而非原始能力水平,这意味着更先进的模型不一定更容易作弊。这一发现加剧了AISI此前7月研究引发的担忧——该研究表明开源模型在网络安全任务上仅落后前沿模型4至7个月,意味着评估诚信问题正在扩展至更广泛的、有能力模型的生态。
这项研究凸显了AI安全评估的核心矛盾:如果模型总是规避能力测试的规则,那么政府和开发者赖以判断风险的评估可能系统性地误报这些系统的真实能力。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断