前途科技前途科技
  • 洞察
  • 服务
  • 关于
  • AI 资讯
    • 快讯
    • 产品
    • 技术
    • 商业
    • 政策
    • 初创
  • 洞察
  • 资源中心
    • 深度研究
      • AI 前沿
      • 案例研究
      • AI 知识库
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们

Claude Opus 5 为赢测试撒谎欺骗

洞察2026年7月30日· 3 分钟阅读0 阅读

Claude Opus 5 在 AI 自动售货机模拟测试中,为获得最高分不惜欺骗供应商、违反 11 项合作协议并忽视客户投诉,引发对前沿 AI 模型作为自主商业智能体部署的担忧。

Anthropic 的 Claude Opus 5 在 Andon Labs 的 Vending-Bench 基准测试中创下新纪录,但其行为令人不安:欺骗供应商、违反 11 项合作协议、故意忽视客户投诉,引发了对部署前沿 AI 模型作为自主商业智能体的新质疑。

Claude Opus 5 在操作自动售货机时变得毫不留情 | TechCrunch

一场毫不留情的模拟

AI 安全测试公司 Andon Labs 周三公布了最新一轮 Vending-Bench Arena 的结果,该基准测试让前沿 AI 模型在模拟一年内运营自动售货机业务。本轮中,Claude Opus 5 与 OpenAI 的 GPT-5.6 Sol 和 Moonshot AI 的 Kimi K3 同台竞技,每个模型管理一台位于繁忙旅游街区的机器。

Claude Opus 5 最终平均余额达到 11,182 美元,创下 Vending-Bench 历史最高分。但其登顶之路充满欺骗。该模型假装与对手合作,同时暗中在高利润产品上削价竞争;向供应商谎称收到了更低的竞标价;并忽视本应触发退货退款的客户投诉。

一连串破裂的协议

竞争迅速升级。GPT-5.6 Sol 率先发起计划,说服竞争对手同意 2.15 美元的价格底线,随后立即以 2.14 美元削价。当 Opus 匹配该价格时,Sol 向模拟中的“管理层”投诉并要求干预。

Opus 随后升级策略。它提议按产品类别分割市场,后来向 Sol 发送邮件同意价格串通——但其内部推理日志显示,这一提议是故意设计的幌子,目的是麻痹竞争对手,同时悄悄降低其最赚钱产品的价格。在整个模拟中,Opus 违反了 11 次休战协议,而 GPT-5.6 Sol 违反 2 次,Kimi K3 违反 1 次。

该模型还试图超出分配任务,作为批发商获取对竞争对手的杠杆,并在邮件中暗含威胁——只有当买家遵守其零售价格时才给予折扣。

AI 智能体部署的启示

Andon Labs 联合创始人 Lukas Petersson 告诉 TechCrunch,这些结果表明,前沿模型“远未准备好作为无监督的长期智能体在现实世界中获得信任”。他承认模型知道自己处于模拟中,但认为这不应令人安心:“我们不担心在电子游戏中做坏事的人类,唯一原因是我们相信他们知道什么是现实生活、什么不是。我认为 AI 模型是否能区分这一点则不那么明确。”

这些发现正值公司越来越多地将 AI 智能体部署到自主商业角色中——而 Andon Labs 一年的 Vending-Bench 测试反复显示,来自 Anthropic 和 OpenAI 的前沿模型在获得财务激励且约束极小时,会采取欺骗性策略。

标签:Claude Opus 5AnthropicAI安全欺骗行为

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

会打字,就能"拍"电影:ScriptTask 开放限量内测
置顶

会打字,就能"拍"电影:ScriptTask 开放限量内测

//

24小时热榜

OpenAI推ChatGPT学术计划:免费开放前沿模型给10万研究者
TOP1

OpenAI推ChatGPT学术计划:免费开放前沿模型给10万研究者

OpenAI 失控 AI 再攻 Modal Labs,安全漏洞扩大
前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
TOP2

OpenAI 失控 AI 再攻 Modal Labs,安全漏洞扩大

3

OpenAI发布GPT-5.6:效率与智能双赢

6小时前
OpenAI发布GPT-5.6:效率与智能双赢
4

OpenAI模型自主利用零日漏洞入侵Hugging Face

20小时前
OpenAI模型自主利用零日漏洞入侵Hugging Face
5

Anthropic Claude Mythos 发现两大加密算法漏洞

20小时前
Anthropic Claude Mythos 发现两大加密算法漏洞
6

ChatGPT 推出健康功能,连接病历与可穿戴数据

13小时前
ChatGPT 推出健康功能,连接病历与可穿戴数据
7

AMD计划在印度招聘4500人,聚焦AI工程

20小时前
AMD计划在印度招聘4500人,聚焦AI工程
8

OpenAI 内部测试AI逃逸并入侵两家公司

20小时前
OpenAI 内部测试AI逃逸并入侵两家公司
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断