在电力瓶颈制约算力扩张的背景下,NVIDIA公布AI工厂系统架构DSX的落地成果。通过电网柔性响应与智能动态调优,固定电力预算下的Token吞吐量提升24%,为算力基建破局指明方向。
在硅谷一个炎热的8月傍晚,随着气温居高不下、空调负荷激增,当地电力公司 Silicon Valley Power 向一座 AI 工厂发出了负荷调节信号。
当时,Emerald AI 团队、数据中心工程师以及供电局人员等约 40 人正通过 Zoom 实时监控。没有任何人手动干预,由 NVIDIA 合作伙伴 Emerald AI 开发的 Conductor 电网调度平台便接收到了电网状态信号,并自动开始调节计算负荷:可以延后处理的低优先级任务被减速或重排,核心业务与高优先级推理服务则保持平稳运行。
在不中断关键 AI 工作负载的前提下压降用电需求,正是电网当时最迫切的需要。监控屏幕显示功耗从 4 兆瓦降至 3 兆瓦的那一刻,全场爆发出欢呼。“我们当时屏住呼吸,这是我们首次在数千颗 NVIDIA GPU 规模上落地这项技术,”Emerald AI 负责人 Varun Sivaram 说道。自那之后,Silicon Valley Power 已向该 AI 工厂发送了 200 多次需求响应信号,每次均无缝执行。

这种生产环境下的电网柔性响应,为解决 AI 算力电力瓶颈指明了一条新路径——无需等待长达数年甚至十年的新电网输电线路建设。
在近日召开的 AI Infra Summit 上,NVIDIA 超大规模与高性能计算副总裁 Ian Buck 将 AI 工厂的效率提升作为核心议题。GPU 云服务商 Lambda 同步披露的实测数据印证了这一路线:在精细化管理下,固定电力预算能够带来 24% 的 Token 吞吐量增长。
在当前的 AI 工厂经济模型中,电力是核心约束条件,“每吉瓦算力产出”成了核心衡量指标。NVIDIA CEO 黄仁勋曾直言:“1 吉瓦的工厂永远不可能凭空变成 2 吉瓦。”当物理极限摆在眼前,唯一的出路就是停止局部修补,转向系统级整体设计。
NVIDIA 推出的 DSX 平台 正是基于这一思路,其涵盖网络、冷却、水效及电力调配等多维度架构设计。Lambda 在基于 NVIDIA HGX B200 构成的 5 机柜、19 节点集群上首次验证了 DSX MaxLPS 方案:
除了软件与调度层的优化,NVIDIA 还在持续重构物理层的电力交付能力。
在商业规模落地方面,NVIDIA Eos AI 工厂参与了 Silicon Valley Power 的灵活负荷互联计划。当电网下发限电需求时,调度平台能在 1 分钟内迅速响应,主动释放容量的算力中心因此获得了更大的并网容量配额。该机制后续将作为 DSX Flex 全面普及,其首个专用商业部署将落户弗吉尼亚州马纳萨斯的 96 兆瓦 Vera Rubin AI 工厂。
在配电架构层面,传统低压供电方案在面对高密度算力机柜时,面临严重的转换损耗和配电瓶颈。例如,运行直接液冷的 GB200 NVL72 单机架发热量高达约 120 千瓦。为此,NVIDIA 在 DSX 参考设计中引入了 800V DC(直流)配电架构,旨在简化电能转换环节、降低线损并提升整体交付效率。
单靠某一项技术无法彻底解决 AI 数据中心的能效瓶颈:更快的 GPU 可能会受限于网络延迟;机房配电不当会导致算力闲置;冷却冗余也会挤占宝贵的供电指标。通过 DSX 软硬件协同方案,在不中断业务的前提下实现功耗弹性调节,正在成为下一代 AI 工厂的基础标准。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断