前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
技术/09.15 · 00:00/4 MIN/编译自 Vishal Ganeriwala/1 阅读

从兆瓦到Token:NVIDIA详解AI工厂全栈电力能效优化

在电力瓶颈制约算力扩张的背景下,NVIDIA公布AI工厂系统架构DSX的落地成果。通过电网柔性响应与智能动态调优,固定电力预算下的Token吞吐量提升24%,为算力基建破局指明方向。

在硅谷一个炎热的8月傍晚,随着气温居高不下、空调负荷激增,当地电力公司 Silicon Valley Power 向一座 AI 工厂发出了负荷调节信号。

当时,Emerald AI 团队、数据中心工程师以及供电局人员等约 40 人正通过 Zoom 实时监控。没有任何人手动干预,由 NVIDIA 合作伙伴 Emerald AI 开发的 Conductor 电网调度平台便接收到了电网状态信号,并自动开始调节计算负荷:可以延后处理的低优先级任务被减速或重排,核心业务与高优先级推理服务则保持平稳运行。

在不中断关键 AI 工作负载的前提下压降用电需求,正是电网当时最迫切的需要。监控屏幕显示功耗从 4 兆瓦降至 3 兆瓦的那一刻,全场爆发出欢呼。“我们当时屏住呼吸,这是我们首次在数千颗 NVIDIA GPU 规模上落地这项技术,”Emerald AI 负责人 Varun Sivaram 说道。自那之后,Silicon Valley Power 已向该 AI 工厂发送了 200 多次需求响应信号,每次均无缝执行。

Emerald AI 团队监控功耗自动调节

这种生产环境下的电网柔性响应,为解决 AI 算力电力瓶颈指明了一条新路径——无需等待长达数年甚至十年的新电网输电线路建设。

在近日召开的 AI Infra Summit 上,NVIDIA 超大规模与高性能计算副总裁 Ian Buck 将 AI 工厂的效率提升作为核心议题。GPU 云服务商 Lambda 同步披露的实测数据印证了这一路线:在精细化管理下,固定电力预算能够带来 24% 的 Token 吞吐量增长。

相同能耗产出更多算力:DSX MaxLPS 实测

在当前的 AI 工厂经济模型中,电力是核心约束条件,“每吉瓦算力产出”成了核心衡量指标。NVIDIA CEO 黄仁勋曾直言:“1 吉瓦的工厂永远不可能凭空变成 2 吉瓦。”当物理极限摆在眼前,唯一的出路就是停止局部修补,转向系统级整体设计。

NVIDIA 推出的 DSX 平台 正是基于这一思路,其涵盖网络、冷却、水效及电力调配等多维度架构设计。Lambda 在基于 NVIDIA HGX B200 构成的 5 机柜、19 节点集群上首次验证了 DSX MaxLPS 方案:

  • 动态功耗再分配:模型训练与推理的瞬时功耗特性差异很大。DSX MaxLPS 能够实时监控 GPU 及机架功耗,将静态分配闲置的冗余容量动态再调配。
  • 吞吐量与能效双增:借助该技术,Lambda 在原本仅能支撑 16 个节点满载运行的电力预算内,成功驱动了 19 个节点。整集群 Token 吞吐量从每秒约 400 万 Token 跃升至 500 万 Token,增幅达 24%,每瓦性能提升 23%。
  • 下一代架构潜力:据 NVIDIA 测算,在适配的部署环境下,DSX MaxLPS 可使下一代 Vera Rubin NVL72 AI 工厂在同等兆瓦供电预算下,实现最高 40% 的有效 GPU 算力扩充。

从电网柔性响应到 800V 直流架构

除了软件与调度层的优化,NVIDIA 还在持续重构物理层的电力交付能力。

在商业规模落地方面,NVIDIA Eos AI 工厂参与了 Silicon Valley Power 的灵活负荷互联计划。当电网下发限电需求时,调度平台能在 1 分钟内迅速响应,主动释放容量的算力中心因此获得了更大的并网容量配额。该机制后续将作为 DSX Flex 全面普及,其首个专用商业部署将落户弗吉尼亚州马纳萨斯的 96 兆瓦 Vera Rubin AI 工厂。

在配电架构层面,传统低压供电方案在面对高密度算力机柜时,面临严重的转换损耗和配电瓶颈。例如,运行直接液冷的 GB200 NVL72 单机架发热量高达约 120 千瓦。为此,NVIDIA 在 DSX 参考设计中引入了 800V DC(直流)配电架构,旨在简化电能转换环节、降低线损并提升整体交付效率。

单靠某一项技术无法彻底解决 AI 数据中心的能效瓶颈:更快的 GPU 可能会受限于网络延迟;机房配电不当会导致算力闲置;冷却冗余也会挤占宝贵的供电指标。通过 DSX 软硬件协同方案,在不中断业务的前提下实现功耗弹性调节,正在成为下一代 AI 工厂的基础标准。

标签:NVIDIA数据中心GPU算力基础设施

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

你的 Agent 一次跑对下次还行吗:Pass^k 把一致性差距砍到一半
置顶

你的 Agent 一次跑对下次还行吗:Pass^k 把一致性差距砍到一半

混沌工程从支付带到 AI Agent:三个假设需要改写,四条纪律可以直接抄
置顶

混沌工程从支付带到 AI Agent:三个假设需要改写,四条纪律可以直接抄

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束
置顶

拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束

//

24小时热榜

12分钟跑完5亿元地产投资模型:Claude 颠覆了什么
TOP1

12分钟跑完5亿元地产投资模型:Claude 颠覆了什么

AI竞争的终局不是做大模型,而是争夺基建与权力
TOP2

AI竞争的终局不是做大模型,而是争夺基建与权力

3

打造开源AI音视频编辑器:彻底搞定音画漂移痛点

3小时前
打造开源AI音视频编辑器:彻底搞定音画漂移痛点
4

Anthropic:应通过立法强制推行AI“紧急开关”

23小时前
Anthropic:应通过立法强制推行AI“紧急开关”
5

别等想清楚再动手:用AI拆解庞大任务的“最小第一步”

3小时前
别等想清楚再动手:用AI拆解庞大任务的“最小第一步”
6

AI在狂飙,但人类习惯走得很慢

3小时前
AI在狂飙,但人类习惯走得很慢
7

逃去超市当收银员后,我算出了自己被机器人淘汰的倒计时

3小时前
逃去超市当收银员后,我算出了自己被机器人淘汰的倒计时
8

软件正在吃掉自己:当所有专业都被冠上“产品”前缀

3小时前
软件正在吃掉自己:当所有专业都被冠上“产品”前缀
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断