数据中心/云端

利用 NVIDIA DSX MaxLPS 最大化 AI 工厂的单位功耗性能

AI 工厂是功率受限的工业系统。问题不再是一个数据中心可以容纳多少个 GPU,而是每个可用兆瓦级的 GPU 可以输出多少 AI 输出。对于AI 推理工作负载,这使得应用级每瓦性能成为衡量AI 工厂效率的关键指标。

并非每兆瓦都能转化为创收计算。在到达 GPU 之前,配电、冷却、网络、存储、备份和设施开销会占用一部分电力。静态机架配置使这种情况更加恶化:过时的数据中心设计方法为每个机架分配最大功耗,以满足最坏情况下的峰值需求,即使实际工作负载具有不同的功率需求,并且可能会留下部分最大功耗未使用。运营商保留额外的故障处理能力、运营灵活性和扩展能力。

NVIDIA 检查的一个具有代表性的功耗预算视图中,约 60% 的站点电力被分配用于计算 AI 输出。

NVIDIA DSX MaxLPS 是一套芯片、散热、系统和软件技术,可在固定的功耗预算内更大限度地提高 AI 工厂的吞吐量。MaxLPS 代表“Maximum Land Power Shell” (最大陆地功率外壳) ,这是定义 AI 工厂的站点级约束条件:土地、公用事业电力以及物理外壳保持电力、冷却、网络和计算基础设施。

MaxLPS 旨在优化以下三层:

  • 动态功耗分配:持续监控并将未使用的功耗空间分配给 GPU
  • 高级性能功耗比技术:软件功耗优化技术,可在固定功耗预算下提高工作级别的性能
  • 45 ° C 的热效率和站点设计:通过使用水冷式液冷技术减少冷却用度,提高能源使用效率 (PUE) ,从而在相同的固定范围内直接转化为更多的计算量

为什么静态机架配置会耗电

传统的数据中心功率规划可保留足够的功率,就像每个机架可以同时利用其指定的最大功率一样。这样可以保护设施免受峰值需求的影响,但它将每个机架视为一个独立的电源岛。使用超功率调配的隔离机架无法将未使用的功率借给邻居,而邻居可能会将其转化为 token。

在 AI 工厂规模,设施开销、机架损失以及故障、重启和检查点期间的低效运营会降低 AI 负载的可用功率。另外,静态机架配置可能会在分配给机架的功率范围内占用空间。为一个机架的峰值需求预留的电源可能闲置,而另一个机架可以使用。动态功率分配以这种可回收的机架级净空为目标。

图 1 显示了一座 100 MW AI 工厂的电力预算瀑布。在 100 兆瓦的电网输入中,20 兆瓦用于设施开销,10 兆瓦用于机架损耗,10 兆瓦无法用于 AI 负载,因为在故障、重启和检查点期间运营效率低下。这使得 60 兆瓦的电力可用于 AI 负载。每个扣减额表示为原始网格输入的比例。

训练、后训练和推理涉及计算突发、内存受限执行、同步、检查点、预填充、解码、空闲间隙和网络受限通信。每个阶段的功耗各不相同。为稳定起见,必须配置机架以处理工作负载的峰值功耗,但在有意义的时期内,实际能耗仍低于该峰值功耗。

NVIDIA DSX MaxLPS 动态功耗分配的工作原理是什么?

NVIDIA DSX MaxLPS 使用动态功耗软件 (DPS) (当前处于开发者预览版中) 监控和优化数据中心固定功耗预算范围内的功耗利用率,从而以动态功耗分配取代静态功耗配置。DPS 是一个全面的电源管理系统,可从实用级别到机架、节点和 GPU 对数据中心拓扑进行建模。运营商定义资源组、功率预算和策略,用于指导如何分配、约束和强制电力。

在这些界限内,DPS 会不断将分配的功耗与实际功耗进行比较。当 GPU 或机架的运行水平低于其保留水平时,DPS 可让同一托管组中的其他人使用该空间。现场功率范围保持不变:DPS 可提高可用功率的工作效率。

DPS 运行连续控制循环,如图 2 所示。该系统收集 GPU、机架和组级功耗遥测数据,识别未使用的功耗容量,在策略内重新分配功耗,验证是否符合经批准的组功耗预算,并尽力响应功耗事件或应急策略。

其价值来自于在整个车队中协调多项电源决策,而不是将每个机架视为一次性配置。当站点预算发生变化,或者电网、维护或紧急情况改变可用功率时,DPS 会调整整个数据中心的操作限制,而不会迫使操作员手动重新规划每个机架。

图 3 通过比较静态资源调配与 MaxLPS 动态资源调配的功耗利用率来说明这些效率提升。静态资源调配链的功率为 170 kW,而 MaxLPS 动态资源调配可利用这一空间,在相同的 540 kW 现场功率预算内实现额外的机架部署。

DSX Exchange 是用于 AI 工厂运营的开源事件总线 (目前处于开发者预览版中) 。它增加了一个 IT/ OT 事件总线,将 DPS 和其他 DSX 服务连接到建筑物管理系统、电力监控系统、冷却基础设施、网格接口和计算调度程序。MaxLPS 不需要 DSX Exchange 发挥作用,但集成后会暴露一些信号,例如 DPS 可以处理的季节性冷却空间和设施功率事件。

MaxLPS 技术可实现出色的每瓦性能

除了机架级助力转向之外,MaxLPS 还包含软件功能,可优化每个 GPU 使用其现有功能的方式。

DSX MaxLPS 包含适用于常见数据中心操作模式的优化工作负载配置文件功耗解决方案 (WPPS),包括推理、训练、内存受限和计算受限配置。操作员应用经过验证的配置文件,使计算行为与工作负载保持一致,而不是针对每项作业调整功率、内存、频率和其他节点行为。

应用程序性能和电源管理器 (APPM) 会将选定的配置应用于参与的 GPU,而 NVIDIA Dynamo等软件可以进一步优化推理服务的机架间性能和电源行为。其原则是 AI 工厂优化:调整 GPU 配置、应用程序行为和服务拓扑,以提高整个车队的性能和每瓦输出。

推理提供了一个清晰的示例,因为最大化每瓦特每秒 token 数可以将收益转化为测量的工作负载吞吐量。相同的配置文件也适用于训练和后训练。

对于 NVIDIA Vera Rubin NVL72 AI 工厂,NVIDIA 预计 MaxLPS 与数据中心功耗规划相结合,可以在相同的功耗预算下将 Rubin GPU 的容量提高 40%。这意味着,在一个 100 兆瓦的 AI 工厂中,运营商可以安装 40K Rubin GPU,从而实现表 1 中概述的计算能力。

规格 100 兆瓦 AI 工厂
NVFP4 推理 2 Zettaflops
NVFP4 训练 1.4 Zettaflops
HBM4 显存容量 11PB
HBM4 显存带宽 800 PB/ 秒
表 1. 借助 DSX MaxLPS 与数据中心电力规划相结合,在 100 兆瓦级 AI 工厂中实现计算能力

这些结果与 NVIDIA GB200 NVL72 上的测量结果一起,展示了动态电源管理如何提高 AI 工厂的每兆瓦生产力。

图 4 显示了使用代表性推理工作负载评估的 MaxLPS 结果:Vera Rubin NVL72 使用 DeepSeek-R1 进行测试,GB200 NVL72 使用 Kimi-K2.5 进行测试。MaxLPS 可将 GB200 NVL72 配置的机架功率从 125 kW 降低到 90 kW,将 Vera Rubin NVL72 配置的机架功率从 136 kW 降低到 101 kW,在相同的功率范围内,可在保持工作负载吞吐量的同时,分别将机架功率增加 39%和 35%。每瓦性能在 GB200 NVL72 上提高了约 1.5 倍,在 Vera Rubin NVL72 上提高了约 1.3 – 1.4 倍。

如何针对 MaxLPS 确定 AI 工厂站点的规模

MaxLPS 基础设施设计从固定的设施总功率包络开始,向内工作,以确定站点在 MaxLPS 操作点可以支持的 GPU 机架位置的最大数量。它还建立了电力、冷却、空间和网络容量的长期基础设施目标。

第 1 天部署可能低于此基础架构限制。从训练或训练后繁重的工作负载开始,站点的平均机架功率可能高于 MaxLPS 平均工作点。由于每个机架的功耗更高,因此最初可以在固定设施内部署的机架较少。

因此,MaxLPS 定义了生命周期容量目标,而不是从一开始就填充每个机架的要求。随着硬件生命周期内的工作负载组合转向推理,机架的平均功率可能会下降到 MaxLPS 的平均工作点,从而在不增加设施功率包络的情况下,为填充额外的机架位置创造空间。

如图 5 所示,通过选择 GPU 产品系列、将站点 PUE 目标值设置为 45 ° C DLC 入口操作、调整东西向网络的 MaxLPS GPU 数量,并推导出可部署的 GPU 机架位置总数,MaxLPS 配置从一开始就预测了这一演变。

预计的首发日工作负载组合将决定最初填充的职位数量。通过为完整的 MaxLPS 容量目标预先配置相关空间、配电、冷却和网络容量,运营商可以随着工作负载的变化逐步添加 GPU 和机架,而无需在之后进行设施改造。

为什么 45 ° C 液冷很重要?

数据中心级别的软件助力转向是 MaxLPS 案例中最重要的部分,但它并不是整个系统。MaxLPS 还取决于芯片、散热和系统级的进步,这些进步允许更多的设施功率预算覆盖计算基础设施。

Vera Rubin NVL72 机架专为 45 ° C 液冷入口操作而设计。加热液体听起来可能违反直觉,但其目标是在满足性能、可靠性和使用寿命要求的同时高效散热。较高的冷却液温度可以使设施更频繁地依赖“自由冷却”,即使用室外空气或水来散热,并尽可能减少机械冷却。

根据气候和场地设计,这种方法可以减少对能源密集型冷却器或水密集型绝热 (蒸发) 冷却器的依赖。在高温条件下和对于韧性而言,制冷机仍然很重要,但仅在需要时使用它们会降低整体冷却功率和平均年用电效率 (PUE) 。

恢复用于计算的冷却能力是一个设施设计问题,就像运营问题一样。热系统针对的是最坏的情况,但在典型的操作条件下,许多站点对冷却器压缩机功率的需求要小得多,尤其是当干式冷却器可以处理更多的负载时。如果配电、干冷器和控制器的尺寸适合这种灵活性,那么在一年的大部分时间里,用于在最差时段冷却的电力预算就可以计算了。

高效运行技术冷却系统循环

技术冷却系统 (TCS) 循环是技术侧的液体循环,可在机架、冷板和冷却液分配单元 (CDU) 之间传输热量。它与更广泛的设施冷却回路配合使用,该回路可将热量排除在冷却器、干冷机、冷却塔或其他现场设备之外。运行良好的 TCS 循环平衡了三个约束条件:

  • 调整冷却液流速以匹配 GPU 散热需求,使设施循环能够吸收散热侧的变化
  • 保持在设计的入口温度和热可靠性极限内
  • 在不造成不稳定性的情况下响应工作负载驱动的散热事件

许多设施使用比例积分衍生 (PID) 控制来管理 CDU 行为。PID 控制很常见,也很有用,但它是反应式的,只有在传感器报告偏差后才会做出反应。大型 AI 工厂会快速、同步地改变热负载,因此运营商通常会以低于所需温度的温度运行循环以保持利润。

如上所述,由 PID 控制的保守缓冲区会浪费本可支持计算的冷却能力。代理控制系统,包括 Phaidra 的工作,使用功率遥测和习得的控制策略来预测热行为。45 ° C 热效率的机架不需要代理控制即可运行:硬件和设施设计定义了受支持的散热包络,而代理控制是最重要的优化。

图 6 显示了技术冷却回路与设施冷却回路的对比情况。TCS 循环将来自 GPU 冷板的热量传递到冷却液分配单元 (CDU) ,然后再将其传输到设施冷却循环。然后,设施水泵、冷却器、干式冷却器、冷却塔或其他现场设备会排除建筑物外的热量。可选的监控和预测控制有助于优化效率。

开始使用 NVIDIA DSX MaxLPS 验证

物理基础设施建成后难以更改。无论是升级现有设施还是规划 NVIDIA DSX MaxLPS 站点,运营商都应在站点级别改装或设计 NVIDIA DSX MaxLPS,即使他们在第一天就没有部署每个机架。这意味着,在确定基础架构决策之前,需要验证功率拓扑、冗余、冷却行为、遥测可用性、策略要求、网络容量、机架位置可选性以及空间或可用性限制。

对于评估软件路径的团队而言,NVIDIA Dynamic Power Software 文档NVL72 推理 Power Pilot 是一个起点。范围验证使用代表性工作负载、跟踪吞吐量、延迟、服务错误率、功耗、利用率和策略合规性,将非托管静态基准与 MaxLPS 管理运行进行比较。结果显示了操作员在准备使用 Vera Rubin NVL72 时的扩展时间和速度。

设施团队应尽早与 NVIDIA 合作,在修复基础设施之前验证 45 ° C 入口操作的现场散热设计、MaxLPS 机架位置选项以及配电灵活性。站点级设计决策应尽早做出,且不依赖于软件验证。软件测试可以并行进行,也可以在稍后阶段进行。

为了将固定功率转化为更多 AI 输出,功率受限的 AI 工厂需要一种新的运营模式。静态机架配置链的强大功能,使实际工作负载能够转化为有用的 AI 输出。

NVIDIA DSX MaxLPS 从三个方面解决了这一问题:动态功耗分配软件,可解锁机架搁浅容量;每瓦性能技术,可提高每瓦输出;45 ° C 散热和设施设计,可减少冷却用度,同时保留物理可选性,以获得更多计算能力。对于规划 Vera Rubin NVL72 部署的运营商而言,MaxLPS 是一种在固定功率预算内使站点的 Rubin GPU 容量提高 40% 的途径。

准备好 Vera Rubin NVL72 站点,在固定功耗预算内提供多达 40% 的 Rubin GPU 容量。要开始使用,请阅读 MaxLPS 概述,探索 NVIDIA Dynamic Power 软件文档NVL72 推理电源试点。尽早与 NVIDIA 联系,以验证 45 ° C 的散热设计、机架位置可选性和站点级 MaxLPS 就绪性。

标签