返回 文章 apply CMS 文章

NVIDIA DSX MaxLPS:动态电力共享让 AI 工厂同预算多部署 40% GPU

用策略管控的动态电力共享,把 AI 工厂里被静态峰值预留闲置的电力变成可用的 GPU 容量。

NVIDIA DSX MaxLPSAI 工厂动态电力共享GPU 利用率
成长分 / 100 75 综合收获、行动、留存与影响

NVIDIA DSX MaxLPS:动态电力共享让 AI 工厂同预算多部署 40% GPU
为什么值得读理解静态逐节点峰值预留为何导致设施总用电低于限制、额外 GPU 却离线。

获得一份基于 GB300 NVL72 与 Kimi K2.5 实测的电力-性能权衡数据,包括吞吐量、功耗与尾部延迟变化。

关键洞察
  1. AI 工作负载很少恒定取电,训练与推理在计算、通信、同步、预填充、解码等阶段间波动,静态峰值预留造成预留与实际消耗之间的差距。
  2. DSX MaxLPS 通过拓扑与资源组、遥测、策略、分配与控制、验证与执行五个要素,在运维人员定义的总预算内动态重新分配电力。
  3. 评估中静态基线使用 140 个 GPU,DSX MaxLPS 使用 192 个 GPU,在相同 264.4 kW 配置功耗预算下总吞吐量从 1,084,503 增至 1,618,443 tokens/s,每瓦吞吐量提升 49.2%。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:13087

每一瓦未使用的电力都是被闲置的容量。AI 工厂通常按照所有 GPU 同时达到峰值功耗这一不太可能发生的时刻来配置电力,从而形成一道保护性缓冲,导致宝贵的基础设施在正常运行期间未被充分利用。NVIDIA DSX MaxLPS 采用策略管控的电力共享,在参与资源之间动态分配电力,使客户能够在相同的获批电力预算内部署多达 40% 更多的 GPU。

本技术详解考察了 NVIDIA 与 Nscale 在冰岛凯夫拉维克 Verne 园区 Nscale 数据中心、由可再生能源完全供电的 NVIDIA GB300 NVL72 系统上运行 Kimi K2.5 工作负载时对该方法的联合评估。内容涵盖实测的电力与性能之间的权衡,解释用于维持电气限制的控制手段,并给出一种可重复的验证方法,供运维人员在规模化部署前使用。

静态电力配置如何导致可用电力被闲置

AI 工厂在一系列电气限制的层级中运行。公用事业供电、变电站、配电设备、机架、节点和 GPU 都会施加约束。运维人员必须让每个受管理的边界保持在其获批限制之内,同时满足应用的吞吐量和延迟目标。

静态电力规划通常会为每个节点预留足够的电力,使其能够同时达到指定峰值。这种保守方法简单直接,但 AI 工作负载很少以恒定功率取电。训练工作负载会在计算、通信、同步和检查点之间切换。推理工作负载会在预填充、解码、内存受限工作、网络活动和空闲间隔之间交替。即使是同一模型的实例,也会随着请求形态和并发量的变化而消耗不同的电力。

这种波动在预留峰值电力与实际消耗之间造成了差距。在静态的逐节点预留下,一个预留内部未使用的容量无法用于另一个节点。整个设施的总用电量可能仍低于其限制,而额外的 GPU 容量却处于离线状态。

DSX MaxLPS 监控实际电力消耗,并在参与资源之间动态重新分配可用电力,同时保持运维人员的总预算和策略边界。

三张图表对比 Static MaxP、Static MaxQ 和 DSX MaxLPS。MaxP 使预留电力未被使用。Maxq 将需求限制在固定的逐节点上限,而 MaxLPS 在更多节点之间重新分配电力,同时将总消耗保持在总限制之内。

图 1。Static MaxP 可能使预留电力未被使用;static MaxQ 可能限制性能;DSX MaxLPS 在运维人员定义的限值内动态重新分配电力

DSX MaxLPS 控制回路内部

DSX MaxLPS 结合芯片、系统、散热和软件技术,在土地、电力和外壳(LPS)约束内最大化 AI 工厂产出。Dynamic Power Software 提供策略管控电力分配的控制层。

该控制过程包含五个技术要素:

  • 拓扑与资源组。运营方梳理参与的基础设施,并将节点组织为一个具有总功率预算的受管组。
  • 遥测。系统以足以检测可用余量和新兴功率事件的间隔,采集 GPU、节点、机架和组的功率遥测数据。
  • 策略。运营方定义的规则确立节点限制、组限制、分配优先级、预留要求以及对维护或紧急事件的响应。
  • 分配与控制。当某些资源消耗低于其分配量时,软件会调整参与 GPU 的功率限制,以便其他资源可以使用可用容量。
  • 验证与执行。系统将实测功率与批准的组预算进行比较,并在消耗接近限制时调整分配。

这是协调分配,而不是增加站点的供电。控制回路使得在相同的受管功率预算下能够完成更多有效工作。

该方法如何被评估

在评估中,Nscale 在其数据中心部署了 MaxLPS 软件,并在 NVIDIA 运行工作负载时收集遥测数据。评估测量了控制行为和工作负载权衡。

评估使用了 NVIDIA Blackwell Ultra GPU、FP4 格式的 Kimi K2.5、NVIDIA Dynamo、NVIDIA TensorRT LLM、8K 输入序列长度和 1K 输出序列长度。工作负载组合结合了高吞吐量和低延迟推理实例,在受管组内形成了不同的功率和服务特征。

静态基线使用了 35 个四 GPU 节点,即 140 个 GPU。它运行了两个各使用 52 个 GPU 的高吞吐量实例和一个使用 36 个 GPU 的低延迟实例。DSX MaxLPS 配置使用了 48 个四 GPU 节点,即 192 个 GPU。它增加了一个 52 GPU 的高吞吐量实例,同时保留了相同的 36 GPU 低延迟实例。

作业在四个机架上运行,在两种配置中,每个分布式工作负载都限制在单个机架内。这控制了跨机架性能差异。当测试环境已验证跨机架性能等效时,不需要将分布式工作负载限制在单个机架内。

团队测量了归一化的总吞吐量和每实例吞吐量、首 token 时间、端到端延迟、交互性以及 GPU、CPU 和机架功率遥测数据。比较这些指标可以防止吞吐量增益掩盖延迟、稳定性或功率合规性方面的退化。

配置图显示 140 个基线 GPU 分配在两个高吞吐量推理作业和一个低延迟作业之间。DSX MaxLPS 一侧显示 192 个 GPU,增加了第三个高吞吐量作业,低延迟作业保持不变。

图 2。基线将两个 52 GPU 的高吞吐量实例与一个 36 GPU 的低延迟实例相结合。DSX MaxLPS 增加了第三个 52 GPU 的高吞吐量实例,将集群从 140 个 GPU 增加到 192 个 GPU

测量结果显示了什么

表 1 比较了静态基线和 DSX MaxLPS 配置的容量、吞吐量和功率使用情况。

指标 静态基线 DSX MaxLPS 变化
受管 GPU 140 192 +37.1%
总吞吐量 1,084,503 tokens/s 1,618,443 tokens/s +49.2%
每实例高吞吐输出 59,153 tokens/s 59,220 tokens/s +0.1%
每实例低延迟输出 2,265 tokens/s 2,265 tokens/s 0%
平均 GPU 功耗 97.0 kW 131.8 kW +35.9%
总实测功耗 166.2 kW 198.9 kW +19.7%
功耗预算利用率 62.9% 75.2% +12.3 个百分点
每配置瓦特吞吐量 4.10 tokens/s/W 6.12 tokens/s/W +49.2%

表 1. 静态基线与 DSX MaxLPS 的性能和功耗结果

两种配置均使用相同的 264.4 kW 配置功耗预算。每配置瓦特吞吐量将归一化总吞吐量除以这一固定分母。基线达到 4.10 tokens/s/W,DSX MaxLPS 达到 6.12 tokens/s/W,提升 49.2%。由于配置功耗分母保持不变,该百分比与总吞吐量的增幅一致。

在所示精度下,每实例结果实际上保持不变。这表明,更大的受管集群提高了总吞吐量,而没有实质性降低现有高吞吐或低延迟实例的吞吐量。

在延迟方面,P75 是第 75 百分位结果,意味着 75% 的请求在该延迟或以下完成。P99 是第 99 百分位结果,代表尾部行为:99% 的请求在该延迟或以下完成,而最慢的 1% 耗时更长。中位数和 P75 延迟保持在基线的 5% 以内。P99 首 token 时间从 15.7 秒的基线增加了 17%,表明在评估容量和吞吐量的同时评估尾部延迟的重要性。

对比图显示总吞吐量从每秒 1.085 百万 tokens 上升至 1.618 百万 tokens;平均功耗从 166.2 千瓦上升至 198.9 千瓦,每配置瓦特吞吐量从 4.1 上升至 6.12 tokens 每秒每瓦。

图 3. DSX MaxLPS 将归一化总吞吐量提高了 49.2%,从每秒 1.085 百万 tokens 增至每秒 1.618 百万 tokens。在相同的 264.4 kW 配置功耗预算下,每配置瓦特吞吐量从 4.10 增至 6.12 tokens 每秒每瓦

评估揭示的权衡

动态功耗分配使工程权衡在集群层面可观察、可控制;它并不能消除这些权衡。

工作负载组合决定可用余量

DSX MaxLPS 使用此前未使用的余量,因此增加的容量仍会提高平均功耗利用率。可用余量还取决于工作负载组合:互补的功耗曲线比同时达到峰值的工作负载创造更多机会。因此,运营商应针对总功耗限制测试具有代表性的生产工作负载。典型的 AI 工厂运行具有不同功耗曲线的异构工作负载。因此,本研究使用了旨在反映这种可变性的工作负载组合。

尾部延迟揭示服务权衡

稳定的中位数延迟可能掩盖尾部延迟的变化。在本次评估中,中位数和 P75 延迟保持在基线的 5% 以内,但 P99 首 token 时间增加了 17%。生产验收标准应作为研究的一部分来定义。

遥测支持可靠控制

动态分配依赖于可靠的遥测数据。缺失、延迟或映射错误的测量数据可能会削弱机群级别的决策。在本次评估中,使用了站点级遥测数据来验证机架级功率测量。在部署之前,运维人员应确认增加的吞吐量不会损害服务质量或对功率限制的合规性。

综合来看,这些权衡定义了运维人员在部署前应验证的内容。

运维人员如何验证 DSX MaxLPS

使用具有明确边界和验收标准的分阶段验证流程。

定义受管边界。 映射公用设施、配电、机架、节点和 GPU 拓扑。设置资源组预算、预留要求和升级行为。确认哪个测量值代表可强制执行的限制。建立代表性基线。 在静态配置下运行具有代表性的 AI 工厂工作负载组合,使用预期的部署和放置规则。测量性能和功率的时间应足够长,以捕获工作负载变化并确认可重复性。保守地引入策略。 从接近已验证基线的限制开始。在添加节点之前,确认遥测、拓扑、控制响应和预算合规性。逐步增加容量并测试每个阶段。 逐步增加受管节点数量,在每一步比较聚合性能和单实例性能。在继续之前,验证峰值需求、运行转换、遥测故障和功率可用性降低情况下的服务行为。设定生产运行限制。 只有在配置满足吞吐量和延迟目标、保持在受管预算范围内、保留所需预留量,并在故障和转换期间表现可预测时,才批准该配置。

本次评估展示了 DSX MaxLPS 如何在功率受限的 AI 工厂中回收搁浅容量。同样的策略治理方法可以在多样化环境中增加有效算力。运维人员可以根据硬件、工作负载组合、软件、冷却、网络拓扑和服务目标,为每次部署调整最佳运行点。

为已验证的运行目标规划站点

动态分配是一种运维能力,但站点必须能够承载它所启用的容量。配电、冷却、网络架构、占地面积和机架位置应按已验证的生命周期目标进行规划,即使第一天部署的机架数量较少。

对于未来的 NVIDIA Vera Rubin NVL72 AI 工厂,DSX MaxLPS 还将动态功率管理与每瓦性能技术以及专为 45°C 液冷进液运行设计的基础设施相结合。任何 Vera Rubin 容量预测都应与此经过实测的 GB300 NVL72 评估保持独立。

DSX MaxLPS 为运维人员提供了一个框架,将工作负载可变性转化为受管容量。工程工作是定义边界、测量代表性行为、根据服务目标调整策略,并在正常和不利条件下证明合规性。

查阅 NVIDIA DSX MaxLPS 和 NVIDIA Dynamic Power Software 文档,然后使用此验证序列为您自己的 AI 工厂建立生产运行限制。