伴随中国日均Token调用量突破140万亿,AI推理负载激增正推动存储架构重构。除HBM外,SSD与NAND开始突破传统层级限制,数据管理从被动溢出兜底转向主动分层与动态调度,数据供给效率成为算力释放的关键。
在HBM热潮之外,其他存储形式也正在迎来历史性转折。
在GMIF 2026全球存储器行业创新峰会上,摩根士丹利大中华区半导体分析师颜志天指出,在未计入HBM的情况下,2026年全球云数据中心资本支出中存储占比已接近五成,2027年预计进一步升至53%。
资金涌向存储的核心驱动力,是推理侧需求的爆发。截至今年3月,中国日均Token调用量已突破140万亿。三星电子副总裁Kevin Yoon测算,这相当于中国国家图书馆全部藏书对应Token量的20倍以上,接近人类历史上所有出版图书总量的6倍。
面对如此量级的推理负载,存储系统不仅要应对容量膨胀,更要解决多模态数据、长上下文与复杂运行状态带来的访问频率及生命周期差异。传统的“存储金字塔”层级正在被全面细分与重塑。
随着AI竞争重心由模型训练转向规模化推理应用,存储系统面临着三重严峻挑战:
为应对容量、带宽、时延与耐久性的多重挑战,原先负责持久化存储的SSD正在打破固有定位,向计算侧与低成本侧双向延伸。
在控制架构上,慧荣科技等厂商通过存储软件栈识别不同任务阶段(如规划阶段重低时延、检索阶段重高吞吐、执行阶段重高带宽),由SSD控制器按QoS等级动态调整资源。
在物理部署上,闪迪将SSD清晰细分为三类:直连GPU的高速SSD专门承接热KV Cache等高频数据,网络直连SSD兼顾扩展性与算力服务,外部存储型SSD则专注于大容量低频存储。与此同时,北美云巨头已开始使用大容量QLC SSD替代传统机械硬盘(HDD),以降低数据中心空间与能耗。
作为底层介质的NAND闪存同样在突破边界:
传统存储层级遵循“速度越快容量越小、成本越高”的静态分工,往往在显存不足时才逐级溢出至DRAM和SSD。而在当下的大模型推理场景中,数据管理已全面转向系统设计之初的主动分层与动态调度。
以联芸与寅谱联合推出的AI SSD方案为例:针对MoE(混合专家)架构,当前激活的专家权重保存在显存和内存中,未被调用的权重暂存SSD;系统实时预测后续调用的专家,提前完成参数预取;高频KV Cache留在内存,低频部分则主动下沉至SSD。
在更大规模的算力集群中,调度平台开始将数据、存储与GPU代际、网络带宽进行全链路协同。正如行业共识所言,数据供给效率直接决定了算力的实际产出,存储已不再只是安放数据的容器,而是决定AI推理系统吞吐上限的核心支柱。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断