前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
政策/09.20 · 00:00/13 MIN/作者:苏晚/2 阅读

美军险些登临中国货船:出问题的不是 AI 幻觉,是那第二次调用

今年春季,一份由聊天机器人生成的情报险些让美军登临一艘中国货船,军机已升空才被叫停。多数报道把矛头指向"AI 幻觉",但事故真正的发生点是分析员的第二次调用——用模型把错误结论排成了一份"看起来很正式"的摘要。当制作格式的成本归零,格式就不再是流程的凭证。这条链路在中国企业的风控、尽调、审计、病历里同样存在,而出错的那一环,是一份货物清单。

今年春季,伊朗战争正在进行,美军的军用飞机已经升空,武装人员准备登上一艘位于中东海域的中国货船。行动在最后一刻被叫停——支撑这次行动的那份情报,是一个聊天机器人编出来的。

这条消息由 CNN 在 9 月 18 日率先披露,援引四名知情人士。TechCrunch、Ars Technica、Engadget 与中文媒体随后转述。事实链条各家说法一致:美军特种作战司令部的一名分析员(cnBeta 的报道补充说,情报源头是设在夏威夷的美国太平洋特种作战司令部),用聊天机器人处理一份关于该船货物清单的情报资料;按 TechCrunch 的原文,分析员让聊天机器人"把开源数据与机密信号情报综合起来"(synthesize open source data with classified signals intelligence);模型错误识别了船上的货物,得出这艘中国船正在运输核武器计划所需部件的结论。Ars Technica 引述 CNN 的说法,整个报告"完全失实"(entirely false)。一名知情人士对 CNN 说得更直白:这份报告"几乎引发了一场战争"。

几乎所有报道的标题都落在同一个词上:幻觉。这个框架不能说错,但它把注意力引向了一个无解的地方——如果问题是"模型会胡说",那解法就只剩下"把模型做得更准"和"让人多看一眼",而这两条在这起事件里都不成立。模型永远会有出错概率,Ars Technica 提到,有研究者认为幻觉"可能根本无法彻底杜绝";至于"让人多看一眼",这份报告在指挥链里流转了一路,看过它的人不止一个,飞机都升空了才被拦下来。

真正值得停下来看的,是所有报道都写了、但没人拿它当主角的那一句:分析员第二次调用了这个工具。

第二次调用,才是事故发生的地方

TechCrunch 的原文写得很清楚:"The analyst then used the tool a second time to format the erroneous findings into an official-looking summary, which was circulated across command channels."——分析员又用了一次这个工具,把错误的结论整理成一份"看起来很正式的"摘要,然后这份摘要在指挥渠道里传开了。

中文报道里,cnBeta 把这一步的后果说得比英文原文更透:"由于报告形式符合美国军方惯常使用的情报文件规范,因此在传播过程中获得了较高可信度,并迅速在军方内部流转。"

把这两句放在一起,事故的结构就清楚了。第一次调用产生了一个错误的结论,这只是一条错误信息——它本可以停在分析员的屏幕上。第二次调用没有增加任何信息量,它只做了一件事:**给这条错误信息穿上了制式军装。**而在一个靠纸面运转的科层组织里,制式本身就是凭证。

这是一条从来没有被明文写下来、却支撑着整个官僚体系运转的隐含规则:一份文件长成什么样,约等于它经过了什么流程。情报摘要有固定的格式——来源标注、可信度分级、术语、结构、措辞的冷静程度。过去,把一份材料做成这个样子是有门槛的:你得知道格式,得懂术语,得做过这行,而做过这行的人通常也走过它背后的核验流程。格式和流程之间存在一个稳定的相关性,于是接收方可以省掉重做一遍的成本,直接信任格式。几百年来,这个近似都足够好用。

大语言模型做的事,是把"做出格式"的成本降到了零,同时一点没降低"走完流程"的成本。相关性因此断了。而最麻烦的地方在于:断得无声无息。那份摘要上没有任何地方写着"我现在很廉价"。它看起来和过去那些真正经过核验的摘要一模一样——这正是它被信任的原因。

所以这起事件真正的教训不是"AI 会产生幻觉",而是:我们把一个正在失效的可信度代理,继续当作可信度本身在用。

五角大楼
五角大楼。这起险情发生时,美军正在全力推进 AI 在情报与决策环节的部署。图片来源:engadget.com

"人在回路"这次是在的,它没起作用

几乎每一份 AI 治理文件都会写上"human in the loop"。这起事件里,人一直在回路里——写出这份摘要的是人,让它在指挥渠道里一路流转下去的每一道环节上也都是人,最后把它拦下来的还是人。人没有缺席,人只是被骗了。

被骗的原因不是他们粗心,而是他们用的判断依据被伪造了。当一个人在一天里要过目几十份材料时,他不可能对每一份都从原始素材重做一遍,他必须依赖某种低成本的可信度信号——而格式就是那个信号。把更多的人塞进链条,只是增加了更多被同一个信号骗过的人。

这是"人在回路"这个说法最大的问题:它把人当成了一个会独立验证的节点,但人的验证能力是有条件的,条件就是他手上得有便宜的判据。AI 生成物恰好摧毁了最便宜的那个判据。

融合那一步,顺手毁掉了可追溯性

还有一层更技术性的损害,同样没人细说。

分析员让模型做的第一件事,是把开源数据和机密信号情报综合到一起(CNN 的转述用的词是"融合")。这个动作在美国情报界是有成文规矩的:ICD 203《分析标准》(Analytic Standards,2015 年 1 月 2 日签发,适用于整个美国情报界)列出九条"分析技艺标准",排在最前面的两条恰好就是这件事——第一条要求分析产品"恰当说明底层来源、数据与方法的质量与可信度",并按 ICD 206 使用来源描述符;第二条要求"恰当表达并解释重大分析判断所伴随的不确定性",包括事件发生的可能性、以及分析员对该判断的置信度,且必须使用规定的一套等级用语。逐条挂来源、逐条标置信度,不是行业习惯,是写进标准里的硬要求。

接下来这一段需要先声明它是推断。公开报道没有任何一家描述过那份摘要的内部格式——CNN、TechCrunch、Ars Technica、Engadget、cnBeta 都只说它"符合美国军方惯常使用的情报文件规范",没说里面长什么样。但从"用聊天机器人把结论排成制式摘要"这个动作本身可以推出一件事:大模型的默认输出是一段平铺的散文,它把多个来源揉成一个连贯的叙述,而 ICD 203 那两条要求的东西——按 ICD 206 规范写的来源描述符、按规定用语标注的置信度——不会自己长在这段散文里,除非分析员逐条补回去。如果没补,那么这份报告除了是错的,还是不可审计的。

标签:AI幻觉五角大楼军事 AI情报分析AI 治理跨境贸易合规
苏晚
苏晚Su Wan

前途科技 · 前沿主笔

关注 AI 与前沿科技的观察者,前途科技前沿内容主笔。

查看全部文章

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

ColorOS 17 把支付授权收进系统层:AgentOS 争的是被超级 App 拿走的那层
置顶

ColorOS 17 把支付授权收进系统层:AgentOS 争的是被超级 App 拿走的那层

美军险些登临中国货船:出问题的不是 AI 幻觉,是那第二次调用
置顶

美军险些登临中国货船:出问题的不是 AI 幻觉,是那第二次调用

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款

在这个推断成立的前提下,想核验这份摘要的人没办法顺着某一句话往回走一步查出处,因为那条路径不存在。能做的只有从原始货物清单开始把整件事重做一遍——也就是把分析员的工作全部重做。这个成本太高,高到在正常流程里不会有人去做。

最后确实有官员做了一次"进一步核查",把行动拦了下来。但这次核查具体是怎么做的、重查了哪一环、为什么更早的传阅环节上没有人做,五个源里没有一家写,cnBeta 也只有"有官员对这份情报进行了进一步核查"这一句。能确定的只有它发生的位置:传阅链条的最末端,飞机已经在天上。如果上面关于来源链被抹平的推断成立,那么它同时提示了一件事——真正能发现问题的那种核查,成本被推高到了只有在最后关头才有人愿意付。这是提示,不是证明。

加速战略与那把剪刀

Ars Technica 指出了一个不容易被注意到的背景:今年 1 月,美国国防部推出了"人工智能加速战略"(AI acceleration strategy),目标是"让所有适当的数据在联合互通的 IT 系统间可用、供 AI 利用,包括各军种与各部门的任务系统"——原文是 federated IT systems,指各军种、各机构之间联合互通的联邦式系统,不是"联邦(federal)政府的 IT 系统"。五角大楼的公开说法是,AI 在"加速杀伤链"上带来显著优势,让指挥官能在正确的时间做出反应。

这里有一处中英文报道的口径差异值得说明:cnBeta 的中文报道写的是"今年 1 月,美国国防部长皮特·赫格塞思公布了一项名为'人工智能加速战略'的新计划",把这项战略明确归到国防部长个人名下;而 Ars Technica 的原文只写"国防部在 1 月推出",没有点名。这种差异值得自己回一次一手来源。查下来的结果是 cnBeta 更准:这份战略的正式文件名为《Artificial Intelligence Strategy for the Department of War》(美国国防部现已更名为 War Department),由国防部长皮特·赫格塞思于 1 月 9 日以备忘录形式签发,1 月 12 日随其公开讲话与官方新闻稿《War Department Launches AI Acceleration Strategy to Secure American Military AI Dominance》一并发布。署名确实是赫格塞思本人,Ars 那句"国防部"是更粗的口径——不算错,但把责任主体抹掉了。

这类归属差异在转述链条里很常见,读到二手报道时值得留个心眼——尤其当你打算拿它当论据的时候。而这篇文章通篇在讲的那件事,最小成本的版本就是:花五分钟回到一手发布页。

美国国防部长皮特·赫格塞思
美国国防部长皮特·赫格塞思。图片来源:cnn.com

署名清楚了,这项战略的方向也是清楚的:扩大数据可及面,提高生成速度,减少中间环节。把它和上面的分析放在一起,一把剪刀就成形了:

**AI 让"生成一份看起来可信的文件"的产能近乎无限扩张,而"核验一份文件"的产能几乎没变。**核验依然是人工的、慢的、贵的,而且——如上一节所说——如果来源链确实在综合那一步被抹平,它还会更贵。加速战略只作用于剪刀的一边。

GovAI 研究员、美国陆军退役军官 Jake Steckler 对 TechCrunch 说的那两句话,基本就是这把剪刀的注脚。一方面强调:"让军人理解大语言模型固有的不确定性很重要,而对于任何可能导致动用武力的决策——比如目标选择、情报分析、作战规划——这一点尤其关键。那些决策有生死后果。"另一方面也不主张因噎废食:"这些工具在合适的场景下、配上合适的安全护栏是有用的。但把采纳速度置于一切之上,很可能导致事故,而事故只会让军人对这些系统失去信任,最终反而拖慢采纳。"

第二句才是要点。护栏不是减速带,护栏是让你能开快的前提。

一个必须承认的事实:它被拦住了

写这类事情容易滑向危言耸听,所以有必要把另一半讲清楚:**这套系统最终是奏效的。**有人在行动实施前对情报做了进一步核查,发现了问题,行动被取消,没有人开火。

但"奏效了"和"有余量"是两回事。衡量一个安全系统的不是它有没有兜住,而是它在第几道关口兜住的。这次兜住的位置是:飞机已升空、登船人员已就位、距离执行只差一步。这不是余量,这是运气。

而且注意事件的时间背景——这发生在与伊朗交战期间。危机状态下,决策周期被压缩、怀疑的成本被抬高、"再核一遍"最容易被省略。恰恰是最需要余量的时候,余量最薄。

cnBeta 引述一名前美国高级官员的说法也值得记下:军方内部使用的许多 AI 系统,本质上仍建立在商业模型基础之上,与外界常见的聊天机器人并无根本差异。也就是说,这不是某个军用特供系统出了故障,而是一个你我每天都在用的东西,被接到了一条生死链路上。

对中国企业:同构的链条,你大概率也有一条

看热闹很容易,但这起事件的结构在中国企业里到处都是。任何形如"AI 生成材料 → 人审 → 决策"的链条,都和这条情报链同构:

  • 风控部门用模型汇总舆情与征信数据,出一份授信建议;
  • 投行或 PE 用模型把尽调资料整理成备忘录,递到投委会;
  • 会计师事务所用模型起草审计底稿的说明段落;
  • 医院用模型生成病历小结和出院记录;
  • 券商研究所用模型把几篇研报揉成一份晨会纪要。

这些场景的共同点是:**最终读到材料的那个人,不会回到原始素材去核,他信的是这份材料的样子。**而"样子"现在是免费的。

四件可以马上做的事:

**第一,废掉"格式即可信"这条隐含规则,而且要显式地废。**任何由模型参与生成的材料,在流转时必须带着可见、且不可被随手去掉的标记——不是在页脚加一行小字免责声明,而是让审阅者第一眼看到的就是"这是模型产出",而不是"这看起来很正式"。可信度信号被污染了,那就换一个信号,而不是假装它还有效。

**第二,禁掉"第二次调用"。**这起事件里最该被制度拦住的动作,是拿模型去做格式化。这一步不增加任何信息,只增加可信度——从风险收益比看,它是纯风险。如果你的团队里有人用模型把粗糙的结论"润色成正式报告",那就是在做和那位分析员一模一样的事。让粗糙的东西保持粗糙,是一种保护。

**第三,融合类任务必须保留逐条来源。**不要让模型输出一段浑然一体的叙述,要让它输出"断言 + 出处 ID"的结构化列表,每一条都能一键跳回原文。这在工程上不难——RAG 的引用回链、结构化输出、逐句 citation 都是现成的——难的是很多团队觉得"看起来不够专业"而主动放弃了它。恰恰相反:带着出处的粗糙列表,比不带出处的漂亮报告安全一个数量级。

**第四,审的是断言与出处的对应关系,不是文风。**把人工复核的动作重新定义一遍:复核者的任务不是"读一遍看看通不通顺",而是抽取 N 条关键断言,逐条回到出处确认。这个动作慢,所以它只能用在高后果的决策上——而这也正是你该判断的第一件事:**你的哪些链条是高后果的?**在那些链条上,慢是应该的。

还有一层:你的单证,现在是别人 AI 的输入

这起事件里有一个细节值得中国的外贸、航运、物流企业单独拿出来看:模型搞错的是货物清单(cargo manifest)。

过去,一份报关单、提单、装箱单上的描述含糊一点,后果是海关或买方打个电话来问,补份说明了事。现在情况变了——你的单证正在成为境外筛查系统里大模型的输入。模型不会打电话来问,模型会补全。一个语焉不详的型号、一个行业内才懂的简称、一个可能触及两用物项边界的品目描述,落到一个被要求"融合多源情报给出结论"的模型面前,它不会输出"信息不足",它会输出一个听起来合理的猜测。

这不是理论推演,这次错的就是这一环。

所以对做跨境业务的公司来说,有一条以前属于"合规成本"的事,现在应该重新归类为风险敞口:单证描述的精确度。具体到动作上——两用物项的品目描述写全称不写简称,附上 HS 编码与最终用途说明,避免只有内部才看得懂的产品代号,货名与实际货物严格一致,涉及敏感品类时主动附上更多而不是更少的说明性材料。以前这些是为了让人看懂,现在是为了不给模型留下"补全"的空间。

这大概是这条新闻对中国读者最具体的落点:大国之间 AI 军备竞赛的风险,最终是以一份看不懂的装箱单的形式,落到某家外贸公司头上的。

结论

这件事的结论不是"军队不该用 AI",也不是"模型还不够好"。是一件更朴素、也更难做的事:

当生成一份可信外观的文件变得免费,"可信外观"就不再是可信度的证据。任何依赖这个代理的组织——军队、医院、银行、审计所、编辑部——都必须重新去找一个新的代理,或者接受在高后果的链条上把核验成本真正花出去。

那位分析员第二次点下回车的时候,大概只觉得自己是在排版。

LoRA 让异步 RL 跨机只传几 MB:一个桶加一个代理,再靠三处设置提速 3.9 倍
置顶

LoRA 让异步 RL 跨机只传几 MB:一个桶加一个代理,再靠三处设置提速 3.9 倍

//

24小时热榜

Cua 开源 CUA-S1-FORMS:70 万参数的表单填写小模型
TOP1

Cua 开源 CUA-S1-FORMS:70 万参数的表单填写小模型

前线AI研究员集体拉响警报:超级智能失控风险逼近
TOP2

前线AI研究员集体拉响警报:超级智能失控风险逼近

3

OpenAI发布青少年安全蓝图,强化未成年人AI防护

10小时前
OpenAI发布青少年安全蓝图,强化未成年人AI防护
4

英特尔白皮书称:Agent 任务六成时间耗在 GPU 之外

10小时前
英特尔白皮书称:Agent 任务六成时间耗在 GPU 之外
5

美军险些登临中国货船:出问题的不是 AI 幻觉,是那第二次调用

10小时前
美军险些登临中国货船:出问题的不是 AI 幻觉,是那第二次调用
6

马斯克计划低价收购破产初创公司数据,用于训练Grok模型

14小时前
马斯克计划低价收购破产初创公司数据,用于训练Grok模型
7

AI能否通过爱因斯坦测试?GPT-1900复现光量子引热议

14小时前
AI能否通过爱因斯坦测试?GPT-1900复现光量子引热议
8

JEPA-Anything发布:同一预测架构搞定癌细胞与行星轨道

19小时前
JEPA-Anything发布:同一预测架构搞定癌细胞与行星轨道
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断