前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
技术/09.15 · 00:00/5 MIN/编译自 NVIDIA Writers/1 阅读

NVIDIA发布Vera Rubin与DSX能效方案

NVIDIA在AI Infra Summit上展示了Vera Rubin与DSX平台最新进展,通过芯片到电网的联合设计,将每兆瓦Token吞吐量最高提升30倍,从底层重构AI工厂的能效标准。

在圣克拉拉举行的 AI Infra Summit 上,NVIDIA 超大规模与高性能计算副总裁 Ian Buck 发表主题演讲。今年的峰会参会人数突破 8,000 人,规模较去年的 3,500 人实现翻倍,已成为 AI 基础设施领域的标杆活动。

面对 AI 智能体(Agentic AI)带来的海量复杂工作负载,AI 基础设施的核心评价标准正迅速从单纯的「峰值算力」,转向「每兆瓦有效智能体 Token 产出」。NVIDIA 联合生态伙伴公布了一系列技术合作与实测成果:

  • Annapurna Labs(亚马逊旗下):与 NVIDIA 合作研发 NVHBM 定制高带宽内存技术。
  • d-Matrix:将 NVLink Fusion 与其 Raptor XPU 集成,结合 NVIDIA Vera CPU 提供大规模超低延迟推理。
  • Lambda:首测 NVIDIA DSX MaxLPS,在相同功耗预算下将每瓦性能提升 23%。
  • Emerald AI:联合硅谷电力局(Silicon Valley Power)验证商业级 AI 工厂柔性负荷响应方案。
  • Pinterest:采用 Blackwell 平台与 Dynamo 推理软件,将对话式 AI 引入视觉搜索业务。

AI工厂全栈能效

柔性电网接入:DSX Flex 释放电网容量

AI 算力部署受制于电网供给,硅谷电力局推出了柔性负荷并网计划。Emerald AI 基于 NVIDIA DSX Flex 构建了 Conductor 能源管理系统,能够根据实时电网信号和混合能源状况,动态调节 AI 工厂的整体功耗。

在接收到调峰、需求响应或分时电价信号时,系统会在不中断核心任务的前提下,自动下调低优先级任务的功率并在电网平稳后恢复正常。这种「可调负荷」机制让 AI 工厂转变为柔性电网资源,换取了更大的并网接入容量。

Lambda测试结果

动态功耗调优:DSX MaxLPS 释放 24% 吞吐量

AI 云服务商 Lambda 在 Blackwell 服务器上首次验证了 NVIDIA DSX MaxLPS 的实际表现。传统静态配电方案往往会沉淀大量无法使用的富余电力,而 MaxLPS 能跨 GPU 与机架实时监控功耗,根据训练和推理的差异化特征动态调度电力。

实测显示,Lambda 在原本仅能支撑 16 个满载节点的电力预算下,成功运行了 19 个节点。集群 Token 吞吐量从每秒 400 万暴增至 500 万,增幅达 24%,每瓦性能提升 23%。在未来的 Vera Rubin NVL72 部署中,该方案预计可在同等兆瓦预算下多容纳 40% 的 GPU 节点。

Groq 3 LPX 机架渲染图

Vera Rubin 架构携手 Groq 3 LPX:专攻长上下文推理

针对多步骤推理、频繁工具调用的 AI 智能体场景,系统延迟与上下文长度呈爆炸式增长。NVIDIA Groq 3 LPX 为 Vera Rubin 架构注入了高确定性的超低延迟推理能力。

在面对超 2 万亿参数大模型及长上下文时,Vera Rubin 搭配 Groq 3 LPX 和 DSX MaxLPS,相比 GB200 NVL72 实现了最高 35 倍的每兆瓦 Token 吞吐量。在 Qwen 3.8 27B 的 100K 上下文测试中,单用户每秒输出 Token 高达 2,529 个,让智能体在有限的响应时间内可以完成更多轮次的复杂推理。

AgentX 实测表现

SemiAnalysis AgentX 实测:吞吐提升 30 倍,成本骤降 45 倍

权威分析机构 SemiAnalysis 推出的 AgentX 基准测试,完全采集自真实的智能体编程环境,能够完整重现上下文增长、工具调用延迟及子智能体衍生,单次会话的输入 Token 往往达到传统问答请求的 15 倍。

测试数据显示,运行 DeepSeek V4 Pro 模型时,Vera Rubin NVL72 的每兆瓦吞吐量是 GB300 NVL72 的 30 倍,每百万 Token 成本降低高达 45 倍。这一跨越由第六代 NVLink、第五代 Tensor Core 上的 NVFP4 精度,以及 TensorRT-LLM 与 Dynamo 软件栈共同促成。

标签:NVIDIAVera Rubin芯片推理

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

你的 Agent 一次跑对下次还行吗:Pass^k 把一致性差距砍到一半
置顶

你的 Agent 一次跑对下次还行吗:Pass^k 把一致性差距砍到一半

混沌工程从支付带到 AI Agent:三个假设需要改写,四条纪律可以直接抄
置顶

混沌工程从支付带到 AI Agent:三个假设需要改写,四条纪律可以直接抄

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款

初创公司全面实测 Vera CPU

除 GPU 系统外,NVIDIA Vera CPU 在各类高并发智能体应用中同样表现亮眼:

  • Perplexity:在其 SPACE 智能体安全沙箱中,沙箱启动速度提升 1.9 倍。
  • Daytona:实测显示 Vera CPU 对智能体执行性能带来显著提升。
  • ClickHouse:在开源分析型数据库基准测试 ClickBench 中,Vera 拿下历史最优跑分。
  • DeepInfra:基准测试显示智能体编排步骤延迟降低 2.2 倍。
  • Redpanda & Starburst:测试分别显示延迟降低 5.5 倍及查询吞吐量提升 3 倍。

NVLink 机架系统

NVLink 6:超大规模高可用基石

当 AI 集群扩展至数万乃至数十万卡规模时,硬件韧性决定了实际有效算力。NVIDIA NVLink 6 采用了多层弹性容错架构,物理层配备定制前向纠错(FEC)与快速恢复机制,网络层通过信用流控和动态路由隔离单点故障,防止局部异常扩散为全集群停摆,保障大规模 AI 任务全天候不间断稳定运行。

拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束
置顶

拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束

//

24小时热榜

12分钟跑完5亿元地产投资模型:Claude 颠覆了什么
TOP1

12分钟跑完5亿元地产投资模型:Claude 颠覆了什么

AI竞争的终局不是做大模型,而是争夺基建与权力
TOP2

AI竞争的终局不是做大模型,而是争夺基建与权力

3

打造开源AI音视频编辑器:彻底搞定音画漂移痛点

3小时前
打造开源AI音视频编辑器:彻底搞定音画漂移痛点
4

Anthropic:应通过立法强制推行AI“紧急开关”

23小时前
Anthropic:应通过立法强制推行AI“紧急开关”
5

别等想清楚再动手:用AI拆解庞大任务的“最小第一步”

3小时前
别等想清楚再动手:用AI拆解庞大任务的“最小第一步”
6

AI在狂飙,但人类习惯走得很慢

3小时前
AI在狂飙,但人类习惯走得很慢
7

逃去超市当收银员后,我算出了自己被机器人淘汰的倒计时

3小时前
逃去超市当收银员后,我算出了自己被机器人淘汰的倒计时
8

软件正在吃掉自己:当所有专业都被冠上“产品”前缀

3小时前
软件正在吃掉自己:当所有专业都被冠上“产品”前缀
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断