随着全国Token日均调用量暴增,国内智算中心GPU平均利用率却不足30%,实际推理输出常远低于芯片标称值。产业瓶颈正从单纯堆砌硬件转向软件栈匹配、网络通信与存储调度等系统级工程能力。

一家中小企业的技术团队近期采购了一批国产GPU,计划在私有化机房中部署开源大模型以搭建内部知识库。然而硬件就位两周后,系统依旧无法稳定运行。虽然这批显卡的标称算力可达国际主流产品的七八成,但在实际推理时,Token的生成速率仅有理论极限的一成左右。
类似困境正在大量企业中反复出现,也映射出当前AI产业基础设施的深层演进。
官方统计数据显示,中国日均AI Token调用量在两年内实现了指数级跃升,但第三方机构调研却显示,国内大量智算中心的GPU平均利用率尚不足30%。一边是前台业务对Token的庞大胃口,另一边则是昂贵的加速卡在机房内闲置或低效空转。
两年前,行业普遍认为掌握算力硬件就拿下了入场券。各地加速建设智算中心,企业争相采购GPU。然而把硬件搬进机房后,团队才发现模型部署的复杂度远超预期。企业面临的典型障碍主要集中在两点:一是由于算子和底层指令未对齐,外部模型在特定芯片上直接报错,无法启动;二是即便跑通,输出性能也断崖式下跌,大量算力损耗在软硬件协同的低效中。
模型本身由海量参数文件构成,属于无状态资产,必须依赖推理后端等运行环境支持。目前业内既有NVIDIA的TensorRT-LLM、华为昇腾的MindIE,也有vLLM、SGLang等主流开源框架。面对市场上数十种加速卡型号、数千个公开模型以及各异的后端优化方案,硬件、后端与模型的排列组合构成了一个复杂的软件黑盒。买卡仅是基础硬件的加法,让软硬件高效咬合才是一道系统级的乘法题。
需求结构的剧变也在加速放大这一矛盾。IDC预测,到2027年中国智能算力中推理占比将达到72.6%。与周期明确、可集中排期的训练任务不同,推理是全天候运行且直接触达最终用户的精细化业务,对响应延迟与成本极为敏感,也最考验底层软件栈的综合调优水平。
决定Token吞吐效率的,不仅是单张芯片的浮点运算能力,更是算力、网络与存储之间的数据流转速率。由于主流大模型体量庞大,单张甚至单台服务器已无法容纳完整权重,跨节点分布式部署成为必然选择,这让节点间的节点通信直接融入了计算的核心链路。
在分布式训练中,梯度同步通信往往占据总耗时的三成以上;而在主流的推理架构中,长上下文生成会产生高达数十GB的KV Cache,需要在计算节点之间高频传递。此外,MoE(混合专家)架构的大量采用导致网络中频繁涌现高并发小数据包,这类通信若交由CPU处理,指令调度耗时将远超数据传输本身。
针对通信时延,业界开始推行由GPU内核直接驱动网卡发起通信的技术,减少CPU介入带来的中转损耗;在存储层面,“以存代算”即复用KV Cache的方式正被普遍采纳,通过将存储协议升级为RDMA直通架构,使加速卡能够绕过系统内存直接读写远端存储,大幅压降端到端延迟。
面对算力转化率低下的挑战,行业正分化出不同的破局路径。
一种路径聚焦于软件栈的“操作系统化”。例如GPUStack等开源项目将多样的推理后端模块化为可即插即用的插件。用户引入新模型时无需大幅重写业务逻辑,底层平台统一承担多租户调度、硬件虚拟化与自动化适配职责,把异构硬件资源封装成稳定输出Token的管道服务,实现计算资源像自来水般开箱即用。
另一种路径则着力于打通硬件传输的高速通道。如中科曙光等企业从集群互联与高性能存储切入,通过深度优化集群网络拓扑与专有协议,在物理层面上解决多卡协作时的数据堵点。
国产加速芯片在工艺与封装上仍与全球顶尖水平存在客观差距,依托系统级协同创新,利用集群调度与通信优化补齐单卡短板,已成为行业必然选择。随着多卡跨硬件混合训练与推理的逐步落地,算力生态的竞争重心,已全面转向软件协同体系与工程交付能力。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断