彭博行业研究最新报告指出,得益于DeepSeek等厂商的突破,中美顶级AI模型的基准测试性能差距已从年初的15%收窄至创纪录的3%。尽管技术迅速逼近,但国内激烈的价格战可能使相关企业在2030年前难以盈利。
中美人工智能模型之间的性能差距已降至历史最低水平。彭博行业研究(Bloomberg Intelligence)资深分析师 Robert Lea 发布的最新报告显示,中国顶尖 AI 系统在基准测试得分上仅落后美国竞争对手 3%。
此前,这一差距在 5 月约为 9%,而在更早前一度达到 15% 左右。Lea 指出,在 DeepSeek 于 9 月发布 V4.1 Flash 模型后,双方差距进一步缩小。这种进步表明中国模型正赢得更多市场份额,同时也让外界对“美国在 AI 领域的技术优势能否长期维持”产生了更多疑问。

9 月,DeepSeek V4.1 Flash 在基准测试 LiveBench 上位列全球第六。这是自 2025 年其 R1 推理模型引发全球关注以来,中国模型获得的最高排名。DeepSeek 最新得分达到 81.1 分,逼近 Anthropic 创下的 83.4 分最高纪录。Lea 表示,这说明该模型已具备与 Anthropic 和 OpenAI 等顶尖系统平分秋色的能力。
分析师的研判正在迅速转变。5 月 DeepSeek 发布 V4 预览版时,Lea 曾对彭博社表示美国领先模型仍享有约 10% 的性能优势。
不过,中国模型在顶尖梯队中所占比例依然有限。LiveBench 排名前 15 的模型中只有 3 款来自中国,且榜单排名仍处在动态变化中。
Lea 将中国 AI 的崛起归功于本土技术研发能力的积累,以及针对国产硬件优化模型的工程能力。报告指出,这些进展让外界开始质疑美国限制英伟达芯片出口的实际成效。相关管制的初衷本是减缓中国 AI 发展节奏,并遏制华为等企业推进自研芯片替代方案。
当前,Anthropic 和 OpenAI 正凭借模型能力优势冲刺万亿美元估值并筹备上市。与此同时,成本更低的中国模型在用户规模上正加速追赶。
但基准测试排名的提升尚未转化为实质利润。Lea 认为,中国 AI 行业可能在 2030 年之前都难以实现盈利。在国内拥有超过 1100 个大语言模型的激烈竞争环境下,企业深陷价格战,主要通过低利润率的 Token 销售维系业务。目前,字节跳动旗下的豆包在 AI 应用变现方面处于领先地位,而 DeepSeek 与腾讯的聊天机器人仍以免费为主。此外,围绕模型蒸馏的争议也让中国模型面临更高的海外监管审查及潜在禁令风险。
Lea 指出,中国 AI 产业若想走向可持续的盈利轨道,必须经历行业洗牌、竞争降温,并形成更为理性的定价机制。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断