NVIDIA在AI Infra Summit上展示了Vera Rubin与DSX平台最新进展,通过芯片到电网的联合设计,将每兆瓦Token吞吐量最高提升30倍,从底层重构AI工厂的能效标准。
在圣克拉拉举行的 AI Infra Summit 上,NVIDIA 超大规模与高性能计算副总裁 Ian Buck 发表主题演讲。今年的峰会参会人数突破 8,000 人,规模较去年的 3,500 人实现翻倍,已成为 AI 基础设施领域的标杆活动。
面对 AI 智能体(Agentic AI)带来的海量复杂工作负载,AI 基础设施的核心评价标准正迅速从单纯的「峰值算力」,转向「每兆瓦有效智能体 Token 产出」。NVIDIA 联合生态伙伴公布了一系列技术合作与实测成果:

AI 算力部署受制于电网供给,硅谷电力局推出了柔性负荷并网计划。Emerald AI 基于 NVIDIA DSX Flex 构建了 Conductor 能源管理系统,能够根据实时电网信号和混合能源状况,动态调节 AI 工厂的整体功耗。
在接收到调峰、需求响应或分时电价信号时,系统会在不中断核心任务的前提下,自动下调低优先级任务的功率并在电网平稳后恢复正常。这种「可调负荷」机制让 AI 工厂转变为柔性电网资源,换取了更大的并网接入容量。

AI 云服务商 Lambda 在 Blackwell 服务器上首次验证了 NVIDIA DSX MaxLPS 的实际表现。传统静态配电方案往往会沉淀大量无法使用的富余电力,而 MaxLPS 能跨 GPU 与机架实时监控功耗,根据训练和推理的差异化特征动态调度电力。
实测显示,Lambda 在原本仅能支撑 16 个满载节点的电力预算下,成功运行了 19 个节点。集群 Token 吞吐量从每秒 400 万暴增至 500 万,增幅达 24%,每瓦性能提升 23%。在未来的 Vera Rubin NVL72 部署中,该方案预计可在同等兆瓦预算下多容纳 40% 的 GPU 节点。

针对多步骤推理、频繁工具调用的 AI 智能体场景,系统延迟与上下文长度呈爆炸式增长。NVIDIA Groq 3 LPX 为 Vera Rubin 架构注入了高确定性的超低延迟推理能力。
在面对超 2 万亿参数大模型及长上下文时,Vera Rubin 搭配 Groq 3 LPX 和 DSX MaxLPS,相比 GB200 NVL72 实现了最高 35 倍的每兆瓦 Token 吞吐量。在 Qwen 3.8 27B 的 100K 上下文测试中,单用户每秒输出 Token 高达 2,529 个,让智能体在有限的响应时间内可以完成更多轮次的复杂推理。

权威分析机构 SemiAnalysis 推出的 AgentX 基准测试,完全采集自真实的智能体编程环境,能够完整重现上下文增长、工具调用延迟及子智能体衍生,单次会话的输入 Token 往往达到传统问答请求的 15 倍。
测试数据显示,运行 DeepSeek V4 Pro 模型时,Vera Rubin NVL72 的每兆瓦吞吐量是 GB300 NVL72 的 30 倍,每百万 Token 成本降低高达 45 倍。这一跨越由第六代 NVLink、第五代 Tensor Core 上的 NVFP4 精度,以及 TensorRT-LLM 与 Dynamo 软件栈共同促成。
免费获取企业 AI 成熟度诊断报告,发现转型机会
除 GPU 系统外,NVIDIA Vera CPU 在各类高并发智能体应用中同样表现亮眼:

当 AI 集群扩展至数万乃至数十万卡规模时,硬件韧性决定了实际有效算力。NVIDIA NVLink 6 采用了多层弹性容错架构,物理层配备定制前向纠错(FEC)与快速恢复机制,网络层通过信用流控和动态路由隔离单点故障,防止局部异常扩散为全集群停摆,保障大规模 AI 任务全天候不间断稳定运行。
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断