大语言模型看似博学,却在事实核查时屡屡翻车。生成机制、搜索依赖和信息污染,让AI工具不仅无法识别谣言,反而可能制造新的误导。本文剖析其底层原因,并探讨应对之道。
大语言模型(LLM)能写文章、能编程,但让它去核查一条新闻的真假,结果往往让人失望。更糟糕的是,它可能一本正经地编造一个来源,让原本的谣言显得更可信。为什么 AI 研究工具在事实核查这个任务上如此脆弱?问题出在多个层面。
LLM 的核心是预测下一个词。它不检索事实,只拼概率。所以当它不知道答案时,会“合理”地补全一个。这就是幻觉(hallucination)。在事实核查场景中,幻觉是致命的——它可能给出一个看似权威的引用,但链接是坏的,作者是虚构的。
举个例子,你问一个 AI 工具“某条政策是否已实施”,它可能基于训练数据里的相似内容,生成一段似乎合理的解释,还附带一个不存在的文件编号。如果你把这段输出直接引用到文章里,错误就被二次传播了。
很多 AI 工具通过搜索引擎获取实时信息。它们把搜索结果的摘要拼接起来作为答案。但搜索引擎的排名并不等于真实性。垃圾网站用 SEO 手段可以排在前面,尤其是医疗、金融类关键词。2019 年就有研究显示,百度关于某些疾病的搜索结果里,广告和伪科学站点占据了大半屏。AI 代理抓取这些内容,等于把垃圾当原料。
更糟的是,现在的网络已经被 AI 生成的虚假内容污染了。根据 NewsGuard 的统计,2024 年有超过 1000 个网站几乎完全由 AI 生成,内容质量低下,很多是营销软文和谣言。当 AI 工具访问这些网站,再用它们训练模型或生成答案,错误信息就像滚雪球一样越滚越大。
一个负责任的核查者会寻找相反证据。但 AI 代理通常只做一件事:找到与问题相关的信息,然后总结。它不评估信源的可信度,不交叉验证多个独立来源,也不检查时间戳。比如你问“某明星是否已澄清谣言”,AI 可能只看到早期的营销号爆料,就把它当作事实输出,忽略了后续的官方回应。
这背后是工程设计的问题。多数 AI 工具追求回答速度和用户满意度,而不是准确率。它们甚至会用“多说一点”来掩盖不确定性。OpenAI 的研究也承认,当前模型在需要多跳推理的核查任务上,成功率依然很低。
很多用户把 AI 工具当百科全书。界面设计也强化了这种信任——一个整洁的答案框,附上几个引用链接,看起来像一篇严谨的调查报告。但那些引用可能只是伪装的。据 《Nature》2023 年的一篇报道,有研究者发现 ChatGPT 生成的引用中,有 30% 是完全伪造的。当一个工具自信地给出虚假来源时,用户很难怀疑。
我们需要意识到:AI 是概率机,不是事实库。它擅长的是重组语言,而不是验证真理。
不是没有改进方向。业界已经在做几件事:
但这些都是技术修补。真正的核心是用户教育——别把 AI 输出当作结论,把它当作线索。当你在微信上看到一条炸裂消息,与其问 AI“这是真的吗”,不如直接用官方渠道交叉验证。AI 可以帮你整理信息,但做决定的人还是你。
AI 研究工具在事实核查上的失败,不是 bug,而是特性。它反映了生成式 AI 的底层局限:没有判断力,只有概率。要在这个充满噪音和信息战的时代存活,我们需要的是批判性思维,以及对任何“权威”保持一份合理的怀疑。AI 是工具,不是神谕。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断