NVIDIA 发布新一代 AI 平台 Vera Rubin,采用七芯片五托盘的极致协同设计。CoreWeave 基准测试显示,Vera Rubin NVL72 每兆瓦 Token 吞吐是 Grace Blackwell 的 10 倍,Token 成本降低 90%。Google Cloud、DeepInfra 等合作伙伴同步推出新实例和基准,为 AI 工厂提供更高效率。
NVIDIA Vera Rubin 正式登场,并直接进入千兆级规模。
Vera Rubin NVL72 已开始量产,机架在 CoreWeave、Google Cloud、Microsoft Azure 和 Oracle Cloud Infrastructure 等合作伙伴处运行。它覆盖 30 个国家超过 350 个工厂站点,配备了有史以来最大、最成熟的机架级供应链,以满足客户对算力的旺盛需求。
Vera Rubin 平台 从芯片到电网全面设计,旨在提供最高的每瓦性能与最低的 Token 成本。CoreWeave 的首次基准测试 在 DeepSeek-R1 上给出了明确答案:每兆瓦吞吐量比 Grace Blackwell NVL72 提升 10 倍——这正是受电力约束的 AI 工厂最看重的指标。
这一成果得益于七颗芯片和五个机架托盘的极致协同设计——Vera Rubin NVL72、Vera CPU 机架、Groq 3 LPX、Spectrum-6 SPX 和 Vera BlueField-4 STX——全部作为一个单一系统进行工程优化,而非由现成部件拼凑而成。
NVIDIA Vera CPU 是其中的核心。它重新定义了 AI 工厂中 CPU 的能力。为智能体时代设计,其定制 Olympus 核心提供 2 倍单线程性能、3 倍核间带宽以及比竞争对手小芯片设计低 40% 的内存延迟,成为处理最重要智能体工作负载的最高效单线程 CPU。
在网络方面,平台第六代 NVLink 扩展链路在复杂工作负载上实现超过 2 倍吞吐量、3 倍更低延迟和 10 倍更高数据包速率,远超现成以太网。在横向扩展方面,Spectrum-X 以太网结合了 102.4T Spectrum-6 交换机系统、1.6T ConnectX-9 SuperNIC、自适应路由、高级拥塞控制、遥测和开放操作系统支持,使 RDMA 带宽比现成以太网提升 1.6 倍。
全球领先的 AI 基础设施构建者——包括 CoreWeave、Microsoft、SpaceX AI 和 Tesla——是最早引入 Spectrum-6 交换机 以加速 AI 工厂的客户。NVIDIA 采用共封装光学的光子学技术 用于横向扩展——业界首款此类批量生产交换机——功耗降低 5 倍,MTBI 提高 10 倍,CoreWeave、Lambda 和 OCI 为首批采用者。
Spectrum-XGS 以太网通过 1.9 倍的多站点吞吐量将性能扩展到跨站点,因为千兆级 AI 不是单个建筑的问题。
而 NVLink Fusion 将 NVIDIA 基础设施平台开放给第三方 XPU,为合作伙伴在成熟的 NVLink 扩展堆栈和生态系统上提供更快的上市路径。
NVIDIA 三代机架协同设计经验使 Vera Rubin NVL72 系统在托盘中无需电缆、风扇或软管,计算托盘组装时间从数小时缩短至一分钟。
45 摄氏度液冷入口温度设计支持无冷冻机的干冷却器运行。对于新建 AI 工厂,这种高温干冷结合闭环液冷系统每年每兆瓦可节约数百万加仑的水。
Vera Rubin 正在为欧洲 AI 基础设施提供下一代性能。
它是微软和 Mistral 新扩大合作的基础,为欧洲带来前沿 AI,将开源欧洲模型与云端和客户控制环境相结合,使政府和受监管行业能够按自己的方式采用 AI。
这项合作背后是一项价值数十亿美元的新协议,重点扩展欧洲 AI 基础设施。Mistral 将增加其 GPU 容量,利用数千颗最新的 NVIDIA Vera Rubin GPU 为客户增加 AI 计算可用性,并提供训练、推理和大规模部署的共享平台。
NVIDIA Vera Rubin 正在进入全面量产。这款机架级 AI 超级计算机统一了七颗新芯片,协同设计为一个系统,将驱动下一代 Mistral Compute 和微软的欧洲 AI 基础设施,涉及数万颗 GPU。
欧洲希望拥有世界上最强大的 AI,在其法律下运行,靠近本地且完全可控。而门槛不断提高:智能体系统消耗的 Token 量可达传统 AI 应用的15 倍之多,使高效基础设施成为战略优先事项。满足这一期望需要的不仅是算力:AI 需要高效扩展,同时满足地区对数据控制、治理、弹性和战略自主性的要求。
Vera Rubin 为欧洲的开源模型生态提供了计算基础。其全栈架构结合了加速计算、网络和软件,使模型和智能体从训练到生产都能高效运行。
微软、Mistral 和 NVIDIA 携手提供主权就绪的 AI,覆盖公有云、云端连接和完全断网的私有云环境——将开源模型的灵活性与大规模运行所需的基础设施相结合。
Mistral Medium 3.5 和 OCR 4 现已在 Microsoft Foundry 中可用,Mistral 模型也已集成到 Microsoft Copilot Studio。通过 Azure Local 和 Foundry Local,客户可以在云端和客户控制环境中使用相同的模型、工具和操作模式。
政府机构可将 AI 应用于敏感工作流。医疗和金融服务组织可在区域要求内部署。制造商可现场处理数据以加快决策。与 NVIDIA GB200 NVL72 相比,Vera Rubin NVL72 每兆瓦 Token 数提升 10 倍,每百万 Token 成本降低至十分之一,在相同功耗范围内提供更多智能。
主权 AI 不应迫使组织在创新、经济性和控制之间做出选择。Vera Rubin 提供计算基础,微软和 Mistral 提供主权云基础设施和开源欧洲模型——欧洲可以三者兼得。

CoreWeave 与 NVIDIA 采用极致协同设计,在 Vera Rubin NVL72 上实现了数量级的性能飞跃。
与 CoreWeave 等合作伙伴的紧密协作对于将新一代 NVIDIA 加速计算引入 AI 工厂至关重要。
经过数月的协同工程,CoreWeave 成为 首个启动并验证 Vera Rubin NVL72 的 AI 云,并分享了来自生产硬件的首批实测性能数据。
CoreWeave 在 Vera Rubin NVL72 上运行了 DeepSeek-R1 基准测试,每兆瓦每秒 Token 数比 Grace Blackwell NVL72 提升了 10 倍。
每兆瓦 Token 数决定了 AI 基础设施能否盈利地扩展。更高的每兆瓦 Token 数意味着在相同功耗预算下获得更多智能,或在显著更少的电力 上完成相同工作负载。AI 实验室和企业(如 Jane Street)将利用 Vera Rubin 平台在 CoreWeave 云上扩展其 AI 工厂。
DeepSeek R1 的混合专家架构要求在大规模下实现全互联 GPU 通信:每个 Token 必须路由到分布式的专家子网络。Vera Rubin NVL72 的 260 TB/s 全互联 NVLink 6 架构消除了这一限制,使整个机架如同一台统一的加速器。
CoreWeave 是最早将 NVIDIA Spectrum-X Ethernet SN6600-LD 作为 Vera Rubin NVL72 交换架构的部署者之一。
基于 102.4 Tb/s Spectrum-6 交换芯片并采用液冷设计,CoreWeave 部署了密集交换架,每机架提供 1.64 Pb/s 容量,比上一代风冷交换器提升 100%。CoreWeave 还提供了完全无阻塞、多平面、多轨的 Spine-Leaf 架构,连接 Vera Rubin NVL72 GPU 而无超分。

Google Cloud A5X 实例由 NVIDIA Vera Rubin NVL72 和 Google Virgo 网络驱动,提供数据中心级横向扩展架构。
NVIDIA Vera Rubin NVL72 正在驱动 Google Cloud 的首个 A5X 实例,现已为伦敦初创公司 Ineffable Intelligence 运行。
Ineffable Intelligence 开发新一代智能“超级学习器”系统,通过经验持续学习,在所有领域发现新突破。
Ineffable Intelligence 的智能体直接从与环境的交互中学习,而不是来自静态数据集。它们不使用大语言模型,而是通过强化学习开发“超级学习器”系统,在持续模拟的大规模并行环境中生成经验,并迅速将经验转化为策略更新和评估。这些紧密耦合的学习循环对计算、内存带宽和互联提出了极高要求,需要能以极低延迟大规模运行的基础设施。
“下一阶段的研究需要下一阶段的硬件,”Ineffable Intelligence 联合创始人 Lasse Espeholt 说。“我们有幸与 NVIDIA 和 Google Cloud 团队合作,他们让我们提前使用 Vera Rubin。两个团队的支持无与伦比;我们几乎立即就启动并运行起来,已经在为我们的超级学习器测试基础设施。”
NVIDIA Vera Rubin NVL72 专为此类智能体训练 设计,提供可预测的延迟、高利用率以及比上一代系统显著更高的每美元智能,因此成为大规模强化学习的自然平台选择。
Google Cloud A5X 实例在 Google Cloud Next 上公布,是基于 NVIDIA Vera Rubin NVL72 机架级系统的裸金属实例,每个 Token 推理成本比上一代降低 10 倍,每兆瓦 Token 吞吐量提升 10 倍。
A5X 使用 NVIDIA ConnectX-9 SuperNIC 结合下一代 Google Virgo 网络,集群可在单个站点内扩展到数万个 NVIDIA Rubin GPU,在多站点配置中可接近百万个 GPU,为训练、调优和服务前沿、开源、智能体及物理 AI 模型提供统一、AI 优化的堆栈,同时优化性能、成本和可持续性。
该基础设施旨在为下一代强化学习系统解锁突破,推动超级学习和超级智能的发展。

DeepInfra 的基准测试表明,NVIDIA Vera CPU 速度是其他 CPU 的两倍以上,并能支持更多并发 AI 智能体。
云平台 DeepInfra 是 NVIDIA 开放 AI 生态的早期参与者,它使用生产级 AI 智能体基础设施独立设计并运行了基准测试。DeepInfra 每周处理近 5 万亿 Token,其中约 30% 由智能体系统驱动。其云平台专为高吞吐 AI 推理而构建。
基准测试显示,在相同服务质量下,Vera CPU 支持的并发 AI 智能体数量最多可达 1.6 倍,编排速度最高可达其他 CPU 的 2.2 倍,同时提升了基础设施利用率和成本效益。这些结果表明,NVIDIA Vera CPU 能够满足生产级智能体 AI 对成本效益、低延迟和高吞吐的要求。
随着 AI 智能体承担更复杂的推理、规划、工具使用和数据移动任务,CPU 性能在编排每次模型调用周围的工作中变得越来越重要。
作为 NVIDIA 极致协同设计打造 AI 工厂的一部分,Vera CPU 专为智能体工作负载而生。DeepInfra 的基准测试凸显了 NVIDIA Vera CPU 如何帮助云提供商提升基础设施利用率、增加成本效益,并在相同服务质量下支持更多并发 AI 智能体。
原文链接:NVIDIA AI Blog
本文由前途科技编辑整理
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断