大模型推理负载预计将在2026年占据超70%的算力市场,KV Cache激增导致昂贵的GPU频频空转等数据。面对数据搬运瓶颈,行业正通过HBM4E、CXL内存池化、软硬协同及近数据计算重塑存储架构。
过去两年,整个AI产业的焦点几乎全被GPU占据。英伟达的市值、先进制程与算力卡供货周期常年霸占行业头条。然而,当大模型参数突破万亿、行业从“训练驱动”转向“推理驱动”时,存储系统正被迫从幕后走向台前,成为制约AI应用落地的核心瓶颈。

行业数据显示,全球AI推理算力占比预计将在2026年达到70.5%,实现对训练算力的全面超越。与爆发式的推理需求相比,底层内存与SSD的吞吐并没有同等跃升,导致昂贵的算力芯片频繁处于待机状态。
在训练阶段,存储更像仓库,主要负责承载语料数据并定期保存检查点(Checkpoints),需求侧重于大带宽与高容量。但进入推理阶段后,Transformer架构的运算机制让存储直接进入了系统主干道。
模型生成新Token需要与前文所有词元做关联计算,并将中间结果缓存为KV Cache。随着百万级长上下文普及,单次会话的KV Cache可膨胀至数十GB。高昂的HBM难以完全容纳这部分开销,迫使KV Cache向主机DRAM和SSD逐级下沉。这导致了三个核心痛点:
面对算力与存储墙,硬件层面的演进正在提速:
除介质本身升级外,绕过CPU瓶颈的软硬件协同成为行业共识。
英伟达开源cuFile API并推行GPUDirect Storage(GDS),AMD布局ROCm-XIO,主控厂商与系统软件厂商纷纷转向GPU直接发起I/O的架构。在此趋势下,三星推出的开源AiSIO框架允许GPU绕过主机中间层直接读取SSD数据,整机吞吐可实现数千万甚至上亿IOPS,同时大幅解放CPU占用。
更长远的变化在于“近数据计算”(Near-Data Computing)的落地。既然将海量数据频繁搬运至计算核心的代价过高,直接让算力下沉到存储内部便成了最优解:
随着AI演进进入深水区,存储的竞争早已超越单纯的容量与顺序读写参数,向着系统级直连协同与存算融合演进。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断