NVIDIA 在 FMS 大会上宣布开源 cuFile API,让 GPU 直接读写存储,并联合 40 多家厂商推进 Storage-Next 计划。AI 对数据的需求正在重塑存储基础设施,从被动保存到主动加速计算的关键一环。
AI 对数据和上下文窗口的需求持续攀升,远超系统内存的承受范围。但应对手段并非简单地堆叠存储容量,而是需要从 AI 工厂中获取有价值的、可落地的洞察,并构建高效、安全的存储架构来支撑这些洞察。
在近日举行的未来内存与存储大会(FMS)上,NVIDIA 公布了多项存储新进展,强调 AI 的下一轮突破不仅依赖加速计算本身,同样取决于为加速计算提供支撑的存储基础设施。
随着 AI 智能体消耗海量数据,且 GPU 能够直接发起存储请求、产生数千个并发操作,存储系统的压力急剧上升。为了处理这些请求,存储系统需要持续进行加密、压缩、校验和重建。当大量智能体同时访问存储时,这些关键数据服务很容易成为瓶颈。
NVIDIA 技术博客中的基准测试显示,作为 NVIDIA Vera BlueField-4 STX 一部分的 NVIDIA Vera CPU,在两级压缩和加密流水线中的吞吐量比 x86 CPU 最高可提升 3.21 倍。这意味着借助 Vera,存储平台能够更高效地吸收 AI 数据洪流,用更少的计算基础设施获得更高的吞吐量。
在加速计算时代,存储不再是被动保存数据的地方,而是数据路径中的主动参与者。这颠覆了四十年来关于数据该放在内存(应用访问更快)还是存储驱动器(空间廉价且充足)的传统经济学。如今,在 NVIDIA 及合作伙伴的 AI 存储解决方案支持下,同样的权衡在微秒级内完成。缩小 AI 需求与内存短缺之间的差距,取决于从内存、存储制造商到上层软件的全栈深度协同设计。
在 FMS 上,NVIDIA 宣布开源 cuFile API——以及其下的垂直存储软件栈——让 GPU 能够像 CPU 一样直接读写存储。cuFile 是 NVIDIA GPUDirect Storage 的开源组件,可利用数十万 GPU 线程和高带宽内存,实现微秒级的安全存储访问。
这代表了行业正在基于 Linux 最佳实践统一安全优先的存储栈,为 GPU 与数据之间提供互操作性。此外,快速安全的数据访问是支撑主动与被动网络安全措施的基础。cuFile 的开源将有助于以 AI 防御所需的速度提供安全上下文、数据和存储。这类开放技术也支持了 Open Secure AI Alliance 等新倡议。cuFile 的新家位于 GitHub,接受社区贡献,Google、Intel、NVIDIA 和 Meta 为首批维护者,可在多种软硬件平台上优化使用。
NVIDIA 还联合存储行业领导者,推出名为 Storage-Next 的倡议,汇聚存储制造商、控制器供应商、散热设计、冷却与编排运营商以及标准组织,共同定义 GPU 驱动存储的行为,并将其转化为可互操作的开放行业标准。Storage-Next 已吸引包括 DDN、KIOXIA 和 Micron 在内的 40 多家领先存储与闪存厂商。
该倡议基于大规模 AI 数据集的加速数据访问。为此,NVIDIA 提供 SCADA(Scaled, Accelerated Data Access,规模化加速数据访问)框架,让大规模并行的 GPU 只从存储中拉取应用所需的数据,直接进入自身高带宽内存。例如,DDN 正在将 SCADA 与其软件定义的 AI 原生数据智能平台 Infinia 集成,以消除大规模存储瓶颈。
DDN 首席技术官 Sven Oehme 表示:“AI 的成功不取决于企业拥有多少基础设施,而在于他们如何高效使用。我们与 NVIDIA 的合作正在帮助 GPU 与数据之间建立更直接、更高效的连接——让加速计算资源保持高效,缩短获得洞察的时间,帮助客户从 AI 投资中获得更强的业务和财务回报。”
Storage-Next 和 SCADA 是 NVIDIA 在 AI 存储基础设施长期工作的延伸,相关成果包括 NVIDIA Vera BlueField-4 STX——一个模块化的机架级基础,由 NVIDIA Vera Rubin 平台、Vera BlueField-4 存储处理器和 Spectrum-X 以太网提供支持。

NVIDIA STX 通过统一的 NVIDIA DOCA 安全栈,定义了 AI 原生数据平台的新类别,让企业能够在 AI 数据路径中持续实施安全策略。此外,NVIDIA CMX Context Memory Storage 基于 STX,为长上下文、多轮智能体 AI 推理提供了 AI 原生上下文层。
存储层的速度也伴随安全挑战。让应用直接访问驱动器虽然快,但草率实现可能覆盖其他进程的内存——这是安全漏洞而非功能。NVIDIA SCADA 通过将任务一分为二,实现安全的规模化直接访问:需要原始速度的应用用户部分保持在可信计算基之外;一个独立的特权组件在设置阶段,按照标准 Linux 协议,配置用户应用与其授权存储之间的受保护访问。
通过这些在快速、大规模并行、高效、安全的 AI 存储基础设施上的进展,应用和 AI 工厂能够获得更优质的数据,从而以更大规模产出更有用、更准确、更有依据的智能。
原文链接:NVIDIA AI Blog
本文由前途科技编辑整理
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断