前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
技术/09.09 · 00:00/5 MIN/编译自 Leo张ToB杂谈/1 阅读

算力瓶颈转移:存储如何成为AI推理落地的胜负手

大模型推理负载预计将在2026年占据超70%的算力市场,KV Cache激增导致昂贵的GPU频频空转等数据。面对数据搬运瓶颈,行业正通过HBM4E、CXL内存池化、软硬协同及近数据计算重塑存储架构。

过去两年,整个AI产业的焦点几乎全被GPU占据。英伟达的市值、先进制程与算力卡供货周期常年霸占行业头条。然而,当大模型参数突破万亿、行业从“训练驱动”转向“推理驱动”时,存储系统正被迫从幕后走向台前,成为制约AI应用落地的核心瓶颈。

AI存储演进架构图

存储速度掉队,GPU陷入“等数据”泥潭

行业数据显示,全球AI推理算力占比预计将在2026年达到70.5%,实现对训练算力的全面超越。与爆发式的推理需求相比,底层内存与SSD的吞吐并没有同等跃升,导致昂贵的算力芯片频繁处于待机状态。

在训练阶段,存储更像仓库,主要负责承载语料数据并定期保存检查点(Checkpoints),需求侧重于大带宽与高容量。但进入推理阶段后,Transformer架构的运算机制让存储直接进入了系统主干道。

模型生成新Token需要与前文所有词元做关联计算,并将中间结果缓存为KV Cache。随着百万级长上下文普及,单次会话的KV Cache可膨胀至数十GB。高昂的HBM难以完全容纳这部分开销,迫使KV Cache向主机DRAM和SSD逐级下沉。这导致了三个核心痛点:

  1. I/O路径吞吐不足:传统存储为CPU设计,数据流经系统层层转发。在小I/O场景下,大量接口带宽被传统软件栈消耗。
  2. 写入放大损伤性能与寿命:跨请求并发使得KV Cache交错落盘,数据过期时SSD不得不频繁搬移有效数据,引发严重的写放大(WAF)。
  3. MoE架构显存挑战:混合专家模型即便稀疏激活,数万亿参数的完整权重仍需常驻,单机HBM容量不足,只能依赖外部介质提供极高的随机读取吞吐。

硬件突破:从HBM4E到CXL与固件优化

面对算力与存储墙,硬件层面的演进正在提速:

  • HBM进入新周期:三星与SK海力士已相继向客户送样12层HBM4E,单堆栈容量达48GB,引脚传输速度冲上14Gbps至16Gbps,单堆栈带宽突破3.6TB/s,以更少的堆叠层数实现更高的容量密度。
  • CXL推动内存池化:基于CXL 3.2协议的内存扩展模块(如CMM-D)实现了约110纳秒的器件级访问延迟,逼近本地DDR内存。CPU和GPU可直接通过原生load/store指令寻址,成为承载长文本KV Cache卸载的关键底座。
  • 固件智能分流(FDP):引入灵活数据放置(FDP)技术后,主机可向SSD标记数据生命周期,将易过期的KV Cache物理隔离存储。实测显示其可将峰值写放大降低近半,累计NAND写入量减少超30%。
  • 存储介质创新:针对端侧推理与高密度场景,业界通过堆叠技术开发出连接NPU的zNAND-O,以及覆盖最高256TB的QLC高密度企业级SSD,兼顾极限性能与综合TCO。

软件减负与“近数据计算”的兴起

除介质本身升级外,绕过CPU瓶颈的软硬件协同成为行业共识。

英伟达开源cuFile API并推行GPUDirect Storage(GDS),AMD布局ROCm-XIO,主控厂商与系统软件厂商纷纷转向GPU直接发起I/O的架构。在此趋势下,三星推出的开源AiSIO框架允许GPU绕过主机中间层直接读取SSD数据,整机吞吐可实现数千万甚至上亿IOPS,同时大幅解放CPU占用。

更长远的变化在于“近数据计算”(Near-Data Computing)的落地。既然将海量数据频繁搬运至计算核心的代价过高,直接让算力下沉到存储内部便成了最优解:

  • 盘内计算与索引下沉:在RAG(检索增强生成)场景中,直接利用存储主控完成向量索引与相似度粗排,大幅减轻主机和网络压力。
  • KV Cache自治管理:数据冷热分层、预取与清理逻辑正逐步交由存储阵列与盘端固件自主决策。
  • 存算界限模糊化:通过UCIe接口与先进封装技术,闪存与算力单元正高度集成,传统的内存与存储边界正在被大模型重塑。

随着AI演进进入深水区,存储的竞争早已超越单纯的容量与顺序读写参数,向着系统级直连协同与存算融合演进。

标签:AI存储HBMNVIDIA推理

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

拒绝率清零,代价是拒掉 74% 的正常问题:安全对齐评测漏掉的另一半
置顶

拒绝率清零,代价是拒掉 74% 的正常问题:安全对齐评测漏掉的另一半

拆解 Claude 文本水印:不是绿名单,是锦标赛采样,以及它在中国合规里挡得住的那一半
置顶

拆解 Claude 文本水印:不是绿名单,是锦标赛采样,以及它在中国合规里挡得住的那一半

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
NeoMME 拆解:单塔多模态编码器如何把视觉 RAG 索引压到每页 6 KB
置顶

NeoMME 拆解:单塔多模态编码器如何把视觉 RAG 索引压到每页 6 KB

//

24小时热榜

算力瓶颈转移:存储如何成为AI推理落地的胜负手
TOP1

算力瓶颈转移:存储如何成为AI推理落地的胜负手

蚂蚁百灵开源首个金融增强大模型,打通投研工作流
TOP2

蚂蚁百灵开源首个金融增强大模型,打通投研工作流

3

汉朔科技联手拓元智慧,具身机器人进驻全球7万门店

16小时前
汉朔科技联手拓元智慧,具身机器人进驻全球7万门店
4

大模型下半场:决策式AI如何切入产业核心业务

16小时前
大模型下半场:决策式AI如何切入产业核心业务
5

拒绝率清零,代价是拒掉 74% 的正常问题:安全对齐评测漏掉的另一半

16小时前
拒绝率清零,代价是拒掉 74% 的正常问题:安全对齐评测漏掉的另一半
6

赵一鸣好想来缺斤短两背后:万店狂飙的系统性代价

16小时前
赵一鸣好想来缺斤短两背后:万店狂飙的系统性代价
7

英国裁员中国造车:捷豹路虎重构研发体系

16小时前
英国裁员中国造车:捷豹路虎重构研发体系
8

IFA喧嚣背后:中国AI硬件出海欧洲的冷思考

16小时前
IFA喧嚣背后:中国AI硬件出海欧洲的冷思考
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断