AI竞争重心正从模型训练转向持续性海量推理,全球Token消耗迎来指数级爆发。传统堆叠8卡服务器的算力建设思路遭遇通信瓶颈,高密度卡间互连的“超节点”方案成为数据中心破局的核心路径。
随着大模型能力加速演进,AI正在迈入以推理为主的“干活”时代。全球Token消耗量爆发式增长,推动AI基础设施迎来深层变革。以往依靠堆叠服务器、扩张硬件规模的粗放发展路径,边际效用正在持续递减。
算力价值的核心,正从一次性模型训练的峰值能力,全面转向7×24小时不间断的推理开销。
当市场还在关注参数规模与测评榜单时,调用量数据揭示了底层逻辑的转向。公开数据显示,中国日均Token调用量已突破140万亿,较两年前增长超千倍,周调用量更一度超越美国。在聚合平台OpenRouter上,来自中国的调用量占到全球超三分之一。
智能体(Agent)场景的铺开是主要推手。与单次问答不同,智能体需要自主规划、多轮调用与反复试错,单任务Token消耗量可达传统对话的数百乃至数千倍。多家机构预测,未来数年全球Token消耗量将呈现千倍级甚至万倍级的复合增长。
这种转变直接颠覆了算力选型的商业逻辑:
过去数年,数据中心的主流基本单元是“8卡服务器”:在单机箱内集成8张GPU,再通过跨机网络扩展为万卡集群。这套架构在百亿、千亿参数时代尚可支撑,但在万亿参数模型与海量并发推理面前,卡与卡、机与机之间的数据搬运成为最大瓶颈。
即便计算核心算力强劲,一旦互连带宽不足、延迟过高,芯片便会陷入等待,难以发挥真实性能。
针对这一痛点,“超节点”架构开始走向台前。其核心思路是利用高密度互连技术(如NVLink或光互连),将高带宽互连域从原本的8卡扩展至64卡乃至上千卡,把数十至数百颗计算芯片整合为统一寻址、低延迟协同的超大计算单元,让跨卡通信接近内存访问体验。
行业主流厂商纷纷加速跟进:华为推出昇腾960超节点,支持4096卡规模互联;联想展出万全异构智算平台V5.0超节点方案;超聚变等整机厂商也将整机柜方案推向核心位置。大中型算力中心的建设重点,正从零散采购服务器向系统级整机柜方案迁移。
8卡服务器并未立刻被淘汰,在轻量模型、边缘推理和中小规模研发测试中仍具灵活性。但在处理超大规模并发推理的核心场景中,传统服务器堆叠方案已逼近天花板。
尽管架构更先进,超节点技术目前仍面临多重现实挑战:
超节点解决了如何更高效生产Token的技术问题,但算力行业的终极考验,依然是如何把每一张加速卡和每一度电,稳定转化为具备商业回报的AI服务。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断