电力是 AI 工厂 的一项决定性约束。由于 AI 工作负载需要完整的计算平台来为其服务,该平台的每个组件都必须在工厂有限的电力预算内最大化输出。这使得每瓦性能——而非原始的、未归一化的吞吐量——成为衡量 AI 平台价值的终极标准。
NVIDIA Vera Rubin 平台 旨在实现大规模高能效 AI。其核心是 NVIDIA Vera Rubin NVL72,它在最广泛的 AI 计算需求范围内提供强大的每瓦性能——从吞吐量优化的大批量到高交互层级的小批量,适用于开放和闭源模型。
工厂级和机架级电源管理创新推动了 Vera Rubin 在这一重要指标上的表现。在工厂层面,NVIDIA DSX MaxLPS 软件随着工作负载需求的变化在机架之间转移电力,使运营商能够回收搁浅电力,并在相同的站点电力包络内多配置最多 40% 的 GPU,并交付 35% 更高的 token 吞吐量。
在每个 Vera Rubin NVL72 内部,机架级电容器以及荷电状态智能功率平滑软件吸收了训练和推理工作负载的突发功率尖峰,因此工厂可以围绕持续需求而非最坏情况峰值进行规划。这意味着每兆瓦可部署更多计算。
最高交互层级带来了独特的挑战。为此,该平台增加了 NVIDIA Groq 3 LPX 作为低延迟加速器。本文解释了单个 LPX 机架内的创新,这些创新使其成为 Vera Rubin 平台中高能效的贡献者,包括其确定性执行模型。
NVIDIA Groq 3 LPX 机架中有哪些能效技术?
Groq 3 LPX 确定性执行模型允许 LPU 编译器创建一份调度,精确规定每份数据将在何时移动到哪个特定计算单元,以及该操作将精确在何时执行,精确到时钟周期。它扩展到机架中全部 256 个 LPU 芯片,从而实现 长上下文下的超快交互 以及利用这种确定性的电源管理技术。
在 LPU 编译器生成工作负载执行调度后,它可以预测该调度中每个周期的电流消耗。这反过来又支持两项互补技术:
抢占式电源 (PEP):在需求变化到来之前为供电系统做好准备时钟周期合成 (CPS):塑造需求上升和下降的陡峭程度
PEP 和 CPS 共同帮助减少必须持续提供给任何一组芯片的“电压保护带”或“电气安全裕度”,尽管这些电力并不直接为 AI 工作负载供电。减少这一电压保护带意味着稀缺电力中有更大比例可以用于工作负载。

图 1. Groq 3 LPX 确定性使 PEP 和 CPS 等技术能够为相同工作负载带来更高的能效## 在需要时精确向 AI 工作负载供电面临哪些挑战?
为了运行 AI 工作负载,芯片会执行一系列指令,从简单的数据重塑到复杂的、功耗密集的矩阵乘法。几乎所有芯片都包含硬件特性,能够在工作负载运行时,随着资源可用,在这些众多操作之间动态切换。这种灵活性意味着计算密集型操作可能随时被调度执行。为芯片提供电流的系统必须设计为能够处理这种情况。
驱动 AI 工作负载的矩阵乘法和向量乘法涉及短时间内大量晶体管开关,这会在纳秒级尺度上增加芯片的电流需求。芯片从最近的可用来源获取额外电流:位于芯片旁边的电容器,称为去耦电容器(或 decaps)。这些电容器放电会降低芯片电压。
芯片的电路板确实有电压调节器——一种专用电路,其职责是将芯片供电电压保持在设定目标值——但由于电感,它无法瞬时响应,电感会抵抗其输出电流的任何快速上升。尽管如此,电压调节器提供的电流最终会赶上芯片的需求,使电压得以恢复。
这些临时电压下降,最终由 AI 工作负载电流需求的急剧变化驱动,被称为电压跌落。其幅度取决于电流变化的大小,以及 di/dt,即电流的变化率。在其他条件相同的情况下,较大的 di/dt 会导致较大的电压跌落;相反,电流在较长时间内的相同绝对变化将导致较低的 di/dt,从而减少跌落。这些跌落通常不是问题。然而,所有芯片都有一个最低电压(Vmin),低于该电压芯片将无法正常运行,导致错误结果。

图 2. 当芯片快速消耗功率时,去耦电容放电,电压迅速下降,直到稳压器恢复,此时会出现电压跌落为了降低这种最坏情况发生的可能性,芯片在运行时采用电压保护带,提供足够的电源电压裕量,使芯片在瞬态和最坏情况下仍能获得所需的最低电压。大多数时候,提供这种保护带所需的功率实际上是多余的。此外,功率与电压的平方成正比,因此持续多提供 10% 的电压会多消耗 21% 的功率。
NVIDIA Groq 3 LPX 的周期精确调度如何使电流需求可预测?
Groq 3 LPX 的确定性执行模型允许在开始工作负载之前,为 AI 工作负载的运行方式创建调度,包括操作和数据移动。单个 LPU 加速器具有相对较少的独立硬件元件,每个元件都能为最常见的操作提供可预测的快速执行:
- MXM 用于矩阵乘法
- VXM 用于向量运算
- SXM 用于转置和重塑
单个加速器还具有使这些计算单元同步到时钟周期的硬件。在内存方面,每个芯片都有无层次结构的片上 SRAM 存储体。在 LPX 系统层面,LPU 直接相互连接,而不是通过中间介质,从而使数据传输时间更可预测。
确定性将这些不同的硬件元件联系在一起:单个计算、内存读取和芯片间通信在每次运行时都需要相同的时钟周期数。编译器可以利用这一点来规划数据何时需要在这些计算元件之间移动的调度,使数据在需要时准确到达所需位置。这种计算和数据移动的调度还允许编译器提前解决常见的资源冲突,例如两个硬件元件写入同一个内存存储体。

图 3. Groq 3 LPX 执行模型及其编译器输出与动态调度加速器的比较这种周期精确的调度还允许创建工作负载随时间的电流需求。编译器可以在时钟周期级别估计系统将消耗多少电流。

图 4. Groq 3 LPX 周期精确调度,由编译器在 AI 工作负载运行前生成。电流需求曲线可以从该调度中生成## 执行模型如何实现主动电压和时钟控制?
周期精确的调度以及由此产生的电流需求曲线,使 Groq 3 LPX 能够减少电压跌落,并以更小的电压保护带运行。由于编译器知道电流需求何时上升和下降,精确到时钟周期,它可以提前准备供电系统,并通过互补的 PEP 和 CPS 技术来塑造需求中最剧烈的变化。
- PEP 是芯片命令供电网络(PDN)——向 LPU 输送电力的物理电子设备——改变其输出电压的机制。由于编译器知道电流将在哪个周期出现尖峰,它可以足够早地调度该命令,使得在需求到来之前,供电电压已经在变化。因此,去耦电容需要弥补的缺口更小,当电流上升时,芯片的电压下降幅度也更小。
- CPS 使编译器能够调度工作负载中各个时钟周期的缩短或延长。这种逐周期的调度之所以可能,是因为 Groq 3 LPX 的准同步时钟系统,它保持芯片之间的时钟同步,以及芯片内计算元件之间的同步。与 PEP 相比,它允许对电流中最剧烈的变化进行更细粒度的控制。特别是,电流尖峰最高的时钟周期可以被延长,从而降低 di/dt,即电流上升的速率。

图 5. PEP 和 CPS 分别通过塑造电流的供应和需求,使核心电压能够更接近 Vmin 运行,从而减少所需的电压保护带,进而节省功耗PEP 和 CPS 共同为编译器提供了调度电信号甚至时钟周期长度的工具,从而减少电压跌落。在 Groq 3 LPX 系统上的内部测试表明,这种方法可使电压下降减少 60% 以上。据估计,这将使电力系统必须持续为 AI 工作负载提供的基线电压降低高个位数百分比。由于功率与电压的平方成正比,这将有助于实现更高百分比的功耗降低——所有这些都不会影响工作负载。

图 6. 更小的电压保护带降低了供电电压,而节省的功率在每个周期都按该降低量的平方缩放## 在高交互性下提供更高的每瓦性能
Groq 3 LPX 的确定性执行,与规格相近的非确定性系统相比,可将运行相同工作负载所需的功耗降低可能达到较低的两位数百分比。在功率受限的 AI 工厂中,降低这部分开销,就能把固定功率预算中更多的部分留给 token 生成。
Groq 3 LPX 将于 2026 年下半年把这些由确定性带来的功耗控制能力引入 NVIDIA Vera Rubin 平台。它们在工厂层面与 NVIDIA DSX MaxLPS 互补,并与 Vera Rubin NVL72 机架内的 Intelligent Power Smoothing 互补。它们各自在平台的不同层面运行,但都服务于同一个目标:让每一兆瓦电力产出更多有用的 AI 推理。
在平台层面,将 Groq 3 LPX 与 Vera Rubin NVL72 搭配使用,对于 2T+ 参数模型、长上下文和高交互性场景,相比上一代 NVIDIA GB200 NVL72,可实现高达 每兆瓦 35 倍的吞吐量。对于 AI 工厂而言,这意味着在同样严苛的运行点上,能在相同的功率预算内服务多得多的 token。
致谢
本项工作得以完成,离不开 Ashraf Essea、Kibibi Moseley、
Graham Steele、Suhas Somnath、Sarah McKenney、Farshad Ghodsian 和 Eduardo Alvarez 的专业知识与工程贡献。
