随着大模型推理对算力消耗剧增,华为与英伟达相继推出专用KV Cache外置存储设备,通过“以存换算”削减计算成本。然而,由于不同应用对缓存寿命和写入耐久度的需求差异巨大,底层专用SSD的产品规格与标准化方案仍需时间磨合。
大模型推理过程中的 KV Cache(键值缓存),规模已经庞大到需要进行独立管理的程度。这正在成为整个半导体与数据中心存储行业的新共识。
在华为全联接大会上,华为推出了 OceanStor M900;此前 NVIDIA 也发布了面向上下文记忆存储的 CMX(Context Memory Storage)。这类 AI 记忆存储架构的核心目标,是将大语言模型在推理中已生成、且后续可能复用的 KV Cache 进行分层沉淀。一旦后续请求命中缓存,系统便能免去重复的前向计算,直接节省大量算力。
业内技术专家指出,即便命中率已达 90%,进一步将其提升至 95%,也能让需要重新计算的算力开销直接减半。但在高带宽内存(HBM)与 DRAM 成本居高不下的当下,单独为推理缓存建立一套存储层,背后的经济账究竟该怎么算?
KV Cache 外置的本质逻辑是「以存换算」——在计算开销与存储成本之间寻找平衡点。历史生成的 KV 数据直接丢弃还是持久化存储?业界目前的答案显然倾向于后者。
但这需要先算清两笔账:
第一笔账是哪些数据值得存。 消费级应用中的 KV Cache 可能在几分钟或几小时后失效;而大量企业级应用高度依赖长上下文的连贯性,生命周期可以延长至数天甚至数周,跨请求复用历史 KV 的商业回报也更高。
第二笔账是存放在哪种介质中。 若 DRAM 价格低廉且供给充足,纯内存方案自然兼具极致性能与便捷度。但现实情况是 DRAM 极为昂贵且供应受限,这为企业级 SSD 留下了介入空间。相同容量下,DRAM 与企业级 SSD 的成本差异可达数十倍。不过,考虑到性能折损与命中策略,DRAM 换成 SSD 并非 1:1 替换,在实际落地方案中,往往需要配置 5 到 10 倍容量的 SSD 进行分层承接。
目前,多数常规推理业务仍优先压榨服务器节点内部的 DRAM 与本地 SSD。而华为 M900 与 NVIDIA CMX 的出现,标志着这种分层策略正正式从单机走向独立的共享存储系统。
尽管存储整机设备已经亮相,但在最底层的介质层面上,专为承接 KV Cache 优化的 SSD 尚未形成统一的行业标准。
目前主流采购仍以普通企业级 SSD 为主。原因不在于硬件制造难度,而是因为行业尚未完全摸透 KV Cache 带来的实际工作负载特征。最核心的分歧在于数据保留周期与写入耐久度(DWPD):
存储硬件极为依赖标准化来实现规模效应。若各大云厂商与互联网巨头各定一套参数,产品便会沦为高度定制化形态,难以摊薄研发成本。业内人士预估,行业就负载模型达成较统一的标准共识仍需 6 至 12 个月,从标准确立到产品规模化量产又需耗费一年左右。目前北美云厂商已开始针对推理缓存增加 SSD 采购,国内市场则仍以大模型训练与基础推理存储为主,KV Cache 专属硬件仍处于方案探索期。
外置 KV Cache 方案最直接受益的是系统主内存,而非 GPU 显存。其核心价值在于降低服务器对大容量 DRAM 的依赖,用低成本的 SSD 分担冷数据与温数据,降低整机物料成本。
但将历史 KV 下沉至大容量存储,只解决了容量与成本问题,数据搬运的物理瓶颈依然存在:
大模型基础设施正在为「长期记忆」买单。从丢弃重算到以存换算,伴随 KV Cache 生命周期的明朗化,存储分层架构与底层介质形态的博弈才刚刚拉开序幕。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断