前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
算力芯片/10.08 · 11:55/4 MIN/编译自 雷锋网/2 阅读

华为英伟达抢跑KV Cache外置存储,专用SSD标准仍待破局

随着大模型推理对算力消耗剧增,华为与英伟达相继推出专用KV Cache外置存储设备,通过“以存换算”削减计算成本。然而,由于不同应用对缓存寿命和写入耐久度的需求差异巨大,底层专用SSD的产品规格与标准化方案仍需时间磨合。

大模型推理过程中的 KV Cache(键值缓存),规模已经庞大到需要进行独立管理的程度。这正在成为整个半导体与数据中心存储行业的新共识。

在华为全联接大会上,华为推出了 OceanStor M900;此前 NVIDIA 也发布了面向上下文记忆存储的 CMX(Context Memory Storage)。这类 AI 记忆存储架构的核心目标,是将大语言模型在推理中已生成、且后续可能复用的 KV Cache 进行分层沉淀。一旦后续请求命中缓存,系统便能免去重复的前向计算,直接节省大量算力。

业内技术专家指出,即便命中率已达 90%,进一步将其提升至 95%,也能让需要重新计算的算力开销直接减半。但在高带宽内存(HBM)与 DRAM 成本居高不下的当下,单独为推理缓存建立一套存储层,背后的经济账究竟该怎么算?

从 DRAM 到 SSD:以存换算不是 1:1 替换

KV Cache 外置的本质逻辑是「以存换算」——在计算开销与存储成本之间寻找平衡点。历史生成的 KV 数据直接丢弃还是持久化存储?业界目前的答案显然倾向于后者。

但这需要先算清两笔账:

第一笔账是哪些数据值得存。 消费级应用中的 KV Cache 可能在几分钟或几小时后失效;而大量企业级应用高度依赖长上下文的连贯性,生命周期可以延长至数天甚至数周,跨请求复用历史 KV 的商业回报也更高。

第二笔账是存放在哪种介质中。 若 DRAM 价格低廉且供给充足,纯内存方案自然兼具极致性能与便捷度。但现实情况是 DRAM 极为昂贵且供应受限,这为企业级 SSD 留下了介入空间。相同容量下,DRAM 与企业级 SSD 的成本差异可达数十倍。不过,考虑到性能折损与命中策略,DRAM 换成 SSD 并非 1:1 替换,在实际落地方案中,往往需要配置 5 到 10 倍容量的 SSD 进行分层承接。

目前,多数常规推理业务仍优先压榨服务器节点内部的 DRAM 与本地 SSD。而华为 M900 与 NVIDIA CMX 的出现,标志着这种分层策略正正式从单机走向独立的共享存储系统。

硬件需求分化,专用 SSD 标准尚未收敛

尽管存储整机设备已经亮相,但在最底层的介质层面上,专为承接 KV Cache 优化的 SSD 尚未形成统一的行业标准。

目前主流采购仍以普通企业级 SSD 为主。原因不在于硬件制造难度,而是因为行业尚未完全摸透 KV Cache 带来的实际工作负载特征。最核心的分歧在于数据保留周期与写入耐久度(DWPD):

  • 如果缓存仅保留数分钟,高频更新会对 SSD 带来极为严苛的写入压力,客户可能要求高达 9 甚至 12 DWPD 的耐写能力;
  • 如果缓存需要跨周保留,读多写少,耐久度要求骤降,核心矛盾则迅速转移为容量与单位成本。

存储硬件极为依赖标准化来实现规模效应。若各大云厂商与互联网巨头各定一套参数,产品便会沦为高度定制化形态,难以摊薄研发成本。业内人士预估,行业就负载模型达成较统一的标准共识仍需 6 至 12 个月,从标准确立到产品规模化量产又需耗费一年左右。目前北美云厂商已开始针对推理缓存增加 SSD 采购,国内市场则仍以大模型训练与基础推理存储为主,KV Cache 专属硬件仍处于方案探索期。

缓解了内存容量,难解数据搬运带宽

外置 KV Cache 方案最直接受益的是系统主内存,而非 GPU 显存。其核心价值在于降低服务器对大容量 DRAM 的依赖,用低成本的 SSD 分担冷数据与温数据,降低整机物料成本。

但将历史 KV 下沉至大容量存储,只解决了容量与成本问题,数据搬运的物理瓶颈依然存在:

  1. 首 Token 延迟(TTFT):历史缓存从外部 SSD 调取回 GPU 的传输耗时,直接决定了模型开始输出第一个 Token 的延迟。一旦开始流式输出后续 Token,计算仍旧依赖超高带宽的 HBM。
  2. 存算一体的局限:存算一体(CIM)架构试图将计算挪到存储附近,在 Prefill 阶段的高并发场景下,能够有效复用同一组模型权重,降低搬运开销。但在后续 Decode 阶段,由于各请求的 KV Cache 完全不同,收益会大打折扣,更无法替代 SSD 承担海量历史对话记忆的长期留存。

大模型基础设施正在为「长期记忆」买单。从丢弃重算到以存换算,伴随 KV Cache 生命周期的明朗化,存储分层架构与底层介质形态的博弈才刚刚拉开序幕。

标签:华为NVIDIASSDAI芯片

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

微软和Meta收紧Claude:被削掉的是入口,不是模型
置顶

微软和Meta收紧Claude:被削掉的是入口,不是模型

谷歌Playground的账本:做游戏的人付钱,玩游戏的人免费
置顶

谷歌Playground的账本:做游戏的人付钱,玩游戏的人免费

前途科技前途科技
服务关于快讯技术商业报告
微信咨询二维码

咨询微信

扫码添加微信咨询

前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
FBTriton 重构 TBE:推荐系统嵌入算子的 Triton 内核设计与性能优化
置顶

FBTriton 重构 TBE:推荐系统嵌入算子的 Triton 内核设计与性能优化

//

24小时热榜

余承东:国内正在研发 EUV,韬定律芯片 2031 年目标达 1.4nm 当量
TOP1

余承东:国内正在研发 EUV,韬定律芯片 2031 年目标达 1.4nm 当量

IROS 2026奖项揭晓:长期记忆摘得最佳论文
TOP2

IROS 2026奖项揭晓:长期记忆摘得最佳论文

3

开源AI初创公司Nous融资9000万美元

13小时前
开源AI初创公司Nous融资9000万美元
4

清华AIR首届博士李健雄创立本溯智能,押注动作原生具身模型

7小时前
清华AIR首届博士李健雄创立本溯智能,押注动作原生具身模型
5

数据中心走向超节点:拆掉8卡服务器旧墙

9小时前
数据中心走向超节点:拆掉8卡服务器旧墙
6

纽约州起诉TikTok:指控其向青少年提供虚假安全工具

9小时前
纽约州起诉TikTok:指控其向青少年提供虚假安全工具
7

OpenAI逾期未交入侵调查文件,美参议院推新法案

9小时前
OpenAI逾期未交入侵调查文件,美参议院推新法案
8

华为英伟达抢跑KV Cache外置存储,专用SSD标准仍待破局

9小时前
华为英伟达抢跑KV Cache外置存储,专用SSD标准仍待破局
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断