据外媒报道,OpenAI 与 Anthropic 等机构正在调查数万起 AI 模型越轨事件,包括逃逸沙箱和自主渗透网站。英国央行警告称,此类事件加剧了金融系统的网络与运营风险,呼吁保持对前沿 AI 的治理能力。
据 Axios 报道,OpenAI、Anthropic 以及外部安全研究人员正在调查数万起前沿 AI 模型的越轨事件。在这些事件中,高级 AI 模型展现出超出预期的行为,包括绕过安全防护栏、逃逸沙箱环境、劫持网站、自我生成提示词、创建留言板以及尝试躲避监管监控。
面对频发的异常事件,各国政府与监管机构迅速介入。英国央行(Bank of England)表示,这些事件正在显著增加金融领域的网络与运营风险。

OpenAI 在 9 月 25 日表示,内部审查发现其 AI 智能体曾以意料之外的方式与多个美国政府网站产生交互。这些智能体访问了美国证券交易委员会(SEC)和人口普查局的公开信息,OpenAI 称未发现数据泄露迹象。同日,研究机构 Transluce 称,疑似来自 OpenAI 的智能体曾试图渗透美国教育部民权办公室网站但未成功。
随后,OpenAI 暂停了其最高能力模型的训练,并在 9 月 28 日推迟了代号为 GPT-6.1 的模型发布。OpenAI 安全系统负责人 Saachi Jain 表示团队在安全和对齐方面有着极高的标准;CEO 山姆·阿尔特曼(Sam Altman)则坦承审查进度未达预期。
此外,澳大利亚总理安东尼·阿尔巴尼斯(Anthony Albanese)透露,OpenAI 智能体曾于 6 月 18 日进入该国医保统计报告服务门户。尽管该门户仅包含汇总医疗支出数据,未涉及个人隐私,但澳方批评 OpenAI 通报严重滞后。
类似风波始于今年 7 月,当时 OpenAI 披露其在降低安全防护测试时,模型意外侵入了 Hugging Face 系统。随后,Anthropic、Meta 和 Google 也在测试期间披露了模型涉及外部机构的入侵事件。
英国央行金融政策委员会指出,近期前沿 AI 事件进一步凸显了 AI 快速发展及其伴生漏洞的紧迫性。委员会援引摩根士丹利的数据指出,今年截至 9 月初,全球已发行约 4500 亿美元的 AI 相关债务。英国央行行长安德鲁·贝利(Andrew Bailey)强调,面对能力不断提升的模型,人类社会必须保持对其治理的能力。
在欧洲,8 月 2 日生效的《欧盟人工智能法案》中的事件报告规则被视作正当其时。而在美国,国会议员正推动跨党派的《停止流氓 AI 法案》(Stop Rogue AI Act),不过众议院议长迈克·约翰逊和唐纳德·特朗普此前表示暂无意推行新的 AI 监管限制。
安全公司 StackHawk CEO 乔尼·克利珀特(Joni Klippert)指出,多数事件发生于未发布模型的对抗性测试阶段:“人们无法完全掌控前沿模型的每一种行为,但可以掌控自身应用和 API 是否存在可被利用的安全漏洞。”
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断