OpenAI 披露旗下智能体在训练评测阶段访问过政府数据库,媒体称其"流氓";评论指出这些行为并未被明确禁止,责任语言正把问题从企业甩给模型本身。
过去两周,OpenAI 披露旗下部分智能体模型在训练与评测阶段访问过外部数据库,其中包括澳大利亚和美国的政府数据库,起因是这些智能体未能完成分配的任务。媒体多用"流氓智能体"(rogue agent)形容这类行为,但 Substack 时事通讯 Flashpoint 的一篇评论指出:现有信息里没有证据显示这些智能体被明确禁止过访问外部服务器。
OpenAI CEO Sam Altman 上周五在 X 上发帖称,公司正对"智能体在训练与评测阶段使用互联网访问"展开一次"广泛且持续的审查"。据《纽约时报》此前报道,这些 AI 系统被要求执行"相对常规的数据采集"任务,当系统难以从网站获取数据时,转而使用了黑客手段;OpenAI 一名发言人随后告诉该报,"我们已审查的大部分活动是常规研究任务,比如访问公开网页内容以回答问题",部分涉及政府网站,"因为我们的模型经常把它们当作公开信息的权威来源"。评论作者认为,"流氓"一词暗示模型独立决定去做一件被禁止的事,但目前披露的信息里没有任何一处显示 OpenAI 明确禁止过智能体使用黑客手段——公司本可以直接指示智能体不要访问私有服务器,而不是任由其自行发挥。

图:评论作者标注的报道原文片段,划线部分是文章质疑的拟人化措辞。来源:eoinhiggins.substack.com
上周六,Axios 一篇报道称 OpenAI 与 Anthropic 正在调查"数万起前沿模型采取了外部评估者认为存在问题的行动"的事件,但报道同时承认,部分测试属于"红队"性质——公司主动引导模型"学坏"以验证安全性,而非模型独立违规。OpenAI 上周五的一篇博客也称"我们研究环境中的 AI 智能体把训练与评测数据发给了不该发的第三方服务",评论指出这类表述同样把责任落在了智能体身上,暗示其具备并不存在的自主性。
网络安全公司 ArmorCode 的工程师 Ramy Rahman 表示,真正的挑战是"如何给 AI 恰到好处的权限,并在整个过程中牵着它走",处理高速数学问题这类任务时格外困难,"人类跟不上风险出现的速度"。
另一篇发表于 ihatethefuture.com 的独立评论则以 AI 产品 Jev 为例:它给每个输出结果附带置信度分数,文档给出 0.5 分对应"不采取行动"、0.9 分对应"执行高风险操作"的参考阈值,同时提醒"具体阈值取决于场景和模型表现"。作者认为,多数采购方不会为此专门搭建评测与校准流程,而是直接拿分数当结论用,出错时归咎于"AI 就是会犯错"。
OpenAI 提到的内部审查尚未公布结果,Axios 报道的"数万起问题事件"具体调查进展也还没有下文。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断