返回 文章 build CMS 文章

NVIDIA NVLink 6 如何为 AI 工厂提供多层弹性

NVLink 6 用多层弹性堆栈,把 AI 工厂的瞬态错误挡在业务之外。

NVLink 6AI 工厂多层弹性无损网络
成长分 / 100 75 综合收获、行动、留存与影响

NVIDIA NVLink 6 如何为 AI 工厂提供多层弹性
为什么值得读理解大规模 AI 训练与推理中,为什么无损网络是生产级基础设施的先决条件。

看清 NVLink 6 如何从物理层到系统层逐级检测、遏制和恢复错误。

关键洞察
  1. 在大规模 AI 工厂中,瞬态错误、链路退化和节点中断是数学上的必然,被动协议和单点修复不够。
  2. NVLink 6 的弹性是横跨硬件、系统设计和软件的多层堆栈,而非单一机制。
  3. 物理层用轻量级 FEC 加 PLR 重传,在近乎零延迟下纠正错误并把丢包降至零。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:18341

对于大规模 AI 工厂的运营者而言,最大化持续输出对生产力至关重要。在大规模 AI 训练中,集群中的每个 GPU 都必须每秒在数千次集合操作中同步梯度。同样,在推理过程中,计划外停机直接减少所服务的请求总量,严格限制收入创造。

随着 AI 模型呈指数级增长,训练和服务它们所需的网络基础设施必须同步扩展。然而,在大规模部署中,瞬态错误、链路退化和节点中断是数学上的必然。

为了维持最优的集群利用率,网络必须保证这些紧密耦合的工作负载不间断地推进。不能允许单个丢包导致推理延迟飙升或破坏训练集合操作。在大规模下,即使罕见的丢包也可能累积成显著的有效吞吐量下降。这就是为什么真正无损的网络结构是生产级 AI 基础设施的先决条件。

NVIDIA Vera Rubin 是一个全栈 AI 工厂平台,可在所有 AI 和加速计算工作负载之间实现可互换计算。对于 AI 工作负载,它旨在以 ¼ 的 GPU 数量提供训练能力,并以最低的每 token 成本实现每瓦最高的推理吞吐量。Vera Rubin NVL72 是该平台的核心机架级计算引擎,通过 NVIDIA NVLink 6 纵向扩展网络结构将 72 个 Rubin GPU 连接到一个单一的纵向扩展域中,使它们能够作为单个计算单元运行。

NVIDIA NVLink 6 通过全面的弹性框架,为这些工作负载提供了毫不妥协的可靠性。通过原生检测、遏制和恢复瞬态信号错误,NVLink 确保连续运行和最大集群生产力。

为什么多层弹性是唯一路径

在现代 AI 工厂的规模下,被动协议和单点修复从根本上是不够的。作为 AI 互连领域的行业领导者,NVIDIA 将 NVLink 的弹性设计为一个精心集成的多层堆栈,横跨硬件、系统设计和软件。

首先,在物理层和链路层,NVLink 强制实现原生无损网络结构。它通过结合前向纠错(FEC)、物理层重传(PLR)和通用物理层(UPHY)恢复来实现快速纠错和链路稳定性。此外,它利用基于信用的流控(CBFC)从数学上消除丢包,并部署主动错误遏制,在故障级联之前即时隔离故障。

其次,由于任何低于完全系统冗余的设计都是一种负担,该架构设计为零单点故障。冗余交换机托盘、分布式 NMX 控制器和双带外管理路径保证即使个别组件丢失,域仍能保持运行。

最后,在应用层和软件层,Dynamo Shadow Engine Recovery 等功能利用预热副本进程实现近乎瞬时的故障转移,而应用级检查点和恢复机制则确保长时间运行的任务得到严格保护。这种紧密集成的多层方法,是唯一经过验证的方式,能够无缝遏制硬件异常、无中断地保护运行中的工作负载,并提供大规模 AI 所需的毫不妥协的正常运行时间。

NVLink 6 多重弹性堆栈的分层示意图,按恢复时间从下到上排列。物理层:FEC(近乎瞬时)和链路重试,配合 UPHY 恢复和 PLR(低于 1 毫秒)。链路层:接入和主干链路重新平衡以及基于信用的流控制。应用层:软件恢复,包括 NCCL 弹性支持和 Shadow Engine Recovery(约 500 毫秒)。系统层:机架级弹性和应用级检查点/恢复(超过 1 分钟)。

图 1. NVLink 多层弹性堆栈

下面,我们详细介绍这种多层架构在实践中如何运作。

通过物理层从源头缓解错误

在基础物理层,NVLink 直接在硅片层面应对电噪声和信号衰减。在极端信号速率下,噪声引起的位错误不可避免。现成的网络结构依赖于标准的重量级 FEC 算法,这些算法会带来显著的处理开销和多跳延迟。相比之下,NVLink 专为紧密耦合的 scale-up AI 工作负载而设计。

至关重要的是,NVLink 避免了这些重量级 FEC 算法,因为它利用 PLR 作为快速的第二道防线。这种架构协同作用使 NVLink 能够采用轻量级、高效的 FEC 架构。这种方法不仅仅是像基本奇偶校验那样检测故障,而是允许发送端口向数据流附加高级纠错码。

接收端随后使用这些码在传输过程中以数学方式重建损坏的位,以近乎零的延迟代价纠正单比特或多比特错误。这种效率直接促成了 NVLink 能够提供比通用以太网替代方案低 3 倍的端到端延迟和 10 倍高的数据包速率

当错误突发超出这些轻量级 FEC 纠正能力时,第二道防线立即激活。PLR 是一种成熟、经过高度验证的物理层数据包重传机制。通过在物理层直接处理重传,PLR 有效地将数据包丢失降至零,而无需涉及更高级别的软件堆栈。

最后,如果严重退化触发物理链路断开事件,UPHY 恢复会快速重新校准物理参数,同时数据包安全地保存在硬件重放缓冲区中,以确保零数据丢失。

在链路层确保无损交付

向上移动协议栈,NVLink 依赖链路层来管理网络拥塞,而无需涉及更高层的软件。支撑这一层的是 CBFC,这是 NVLink 与传统协议相比,在如何建立原生无损网络结构方面的一个关键差异化因素。基于标准以太网的 scale-up 替代方案试图通过附加机制(如优先级流控 PFC 和显式拥塞通知 ECN)来近似实现无损。

然而,这些被动响应式方法会引入其自身的故障模式,例如队头阻塞、PFC 风暴和死锁。这些脆弱性使拥塞管理本身成为一项弹性风险。此外,传统的基于确认的机制要求接收方在事后发出成功或失败信号,当缓冲区溢出并需要重试时会增加延迟。

借助 CBFC,发送方只有在持有信用额度、表明下一跳有可用缓冲区空间可吸收该数据包时,才会将数据包注入网络。这种主动式方法在设计上消除了数据包丢失,并在硬件层面保证无损传输,而不会出现与以太网 PFC 相关的网络暂停。

由于传输中的数据绝不会被静默丢弃,网络行为保持高度可预测,并具有一致的低延迟。同时,如果底层物理链路性能下降,链路管理器会通过执行接入链路和干线链路再平衡来自主修复 NVLink 网络结构。

最重要的是,它确保硬件故障可以在其发生的本地被隔离,而不会触发困扰现成以太网 AI 集群的级联重传、超时或集合通信停滞。

并排流程图,展示 NVLink CBFC 如何在发送数据前检查缓冲区信用额度以保证零丢包,而以太网 PFC 中接收方必须在缓冲区填满后被动发出暂停帧,从而导致队头阻塞和 PFC 风暴。

图 2. 无损基于信用的流控(CBFC)与以太网优先级流控(PFC)的架构对比

通过应用层软件恢复隔离故障

应用层提供智能的、软件驱动的事务恢复(SW Recovery),执行时间约为 1.5 秒。当发生链路错误时,NMX 控制器直接与 GPU 驱动程序交互,将受影响的链路置于“隔离并排空”状态。这使硬件能够自动重新训练性能下降的链路而不损坏数据,同时防止网络结构范围的背压。

为消除控制平面的单点故障,NVLink SDN 控制(NMX-C)利用 NMX 高可用性(NMX-HA)。NMX-C 托管在其中一个交换机托盘上,如果主主机发生故障,它会在几秒钟内自动将其功能控制器迁移到备用托盘。此外,NVLink 交换机托盘数据平面与运行 NVOS 的交换机管理 CPU 完全解耦。即使发生计划外的 CPU 重置或操作系统故障,数据平面也会继续不间断转发,使 NVOS 能够恢复而不会出现数据包丢失或工作负载中断。

借助影子引擎恢复的 NCCL 软件级弹性

虽然 NVLink 的物理层和链路层成功遏制并纠正了绝大多数信号错误,但不可纠正的链路退化偶尔仍会到达软件栈。在多 GPU 推理部署中,LLM 依赖 NVIDIA 集合通信库(NCCL)在 NVLink 结构上快速同步数据。如果某条 NVLink 连接遭遇严重中断,可能引发瞬时通信故障,导致 NCCL 操作失败,并迫使正在运行的 LLM 引擎中止。

过去,这需要推理引擎完全冷重启。该过程包括将模型权重重新加载到 HBM、重新编译内核以及重新捕获 CUDA 图,所有这些都可能中断推理服务数分钟,并严重影响 token 吞吐量。为消除这一瓶颈,软件弹性栈采用了 Shadow Engine Recovery,这是 NVIDIA Dynamo 中的一项功能,旨在绕过冷重启并在数秒内恢复推理容量。

由于 NCCL 通信器与其创建时正在运行的特定活动进程集紧密绑定,因此在崩溃后无法动态移交给替代进程。

Shadow Engine 架构通过维护一个与活动推理引擎并存的、完全初始化的空闲副本进程来解决这一问题。在启动期间,该备用引擎会预先建立自己独立的 NCCL 和 NIXL 通信器。如果硬件故障中断了主进程的通信上下文,影子引擎已经拥有绑定到 NVLink 结构的健康、预热好的网络拓扑。这使其能够立即恢复分布式操作,例如张量并行(TP),而无需等待重建 NCCL 通信器或重新加载模型权重。在 NVIDIA B200 GPU 上的基准测试部署中,影子引擎恢复将推理停机时间从 283 秒缩短至仅 7.3 秒。

此外,对于需要在硬件中断期间适应节点数量变化的工作负载,软件栈集成了 NCCL 弹性支持以动态扩展通信器,并保持作业平稳运行。

柱状图显示在推理期间丢失 2 个工作节点中的 1 个后恢复服务容量所需的时间。冷重启的恢复时间为 283 秒,而使用影子引擎恢复时为 7.3 秒。图表强调影子引擎恢复快 39 倍。

图 3. 使用 Shadow Engine Recovery 与冷重启的恢复时间对比

借助 CUDA 检查点实现 NCCL 软件级弹性

有时,中断确实会发生,并且需要在新节点上重启推理引擎的部分或全部进程。为加速这些场景,CUDA 支持使用 CRIU 进行进程级检查点。这使完整的 LLM 工作进程能够在 GPU 上快速进行检查点保存和恢复,从而绕过启动开销。Dynamo Snapshot 集成了这项工作,将启动时间提升了一个数量级。

直到最近,这种检查点方法仅包含节点本地状态,并且必须在创建任何网络连接或 CUDA 图之前进行。为了克服这一限制,NCCL 引入了对 cuda-checkpoint 的原型支持(预计今年年底正式可用),允许多节点检查点捕获启动和加载 LLM 推理引擎时执行的几乎所有工作。这种方法显著降低了推理服务和代理等延迟敏感型工作负载的启动和重启开销。

基于这一弹性软件基础,应用程序还可以通过 NVIDIA NeMo 框架可靠地利用异步检查点,或通过 NVComp 进行检查点压缩,以通过高带宽 NVLink 结构保存状态,从而进一步节省时间。对于大规模前沿模型,这种组合极大地减少了同步阻塞时间,将检查点开销从几分钟降低到几秒钟,并确保在发生故障时快速恢复。

一个双面板图,顶部显示多个通信 GPU 处于活跃处理和通信状态,并有一个标记为“Checkpoint”的过渡指向下方面板,该面板描述了已移至持久存储的进程状态。另一个标记为“Restore”的过渡指回顶部面板,将持久检查点从休眠状态移回活跃处理。

图 4.

使用 NCCL 通信器的多节点 CUDA 检查点

通过机架可维护性保持正常运行时间

在宏观层面,系统层管理长期状态保存以及物理机架规模的健康和可维护性,处理时间超过一分钟的重大恢复。这种宏观层面的弹性依赖于网络和计算堆栈之间的深度集成。NCCL 天生了解 NVLink 拓扑,使其能够通过重建集合环或树来动态适应降级链路,以绕过故障硬件。

CUDA 协同工作,为有序内存操作提供更丰富的错误报告和弹性模型。通过将硬件故障清晰地暴露给运行时,而不是允许系统静默挂起,CUDA 确保应用程序保持感知和响应。

对于物理数据中心运营,交换机管理状态将 NVSwitch 托盘维护转变为有针对性的、非中断的操作。系统管理员可以更换单个交换机托盘,而无需排空整个 NVLink 域或中断活跃的 AI 作业。管理状态将更换的链路保持在非运行模式,防止在明确验证和启用之前过早纳入链路。

此外,NVLink 原生支持部分填充的机架。NMX 控制器自动发现可用硬件,并为任何存在的物理计算或交换机托盘配置路由,从而在分阶段部署或维护周期中实现无缝运行。

通过 NVLink Fusion 将多层弹性扩展到自定义 XPU

上文详述的全面弹性技术栈并不局限于使用 NVIDIA GPU 的部署。随着超大规模云服务商和 AI 原生企业越来越多地为专用工作负载构建定制 XPU,它们同样需要在规模化条件下达到同样毫不妥协的可靠性水平。从历史上看,将最先进的、具备容错能力的纵向扩展网络集成到定制芯片中一直是一项巨大的工程难题。

NVLink Fusion 通过将 XPU 连接到 NVIDIA AI 基础设施来应对这些挑战。这种集成使第三方芯片能够无缝继承本文通篇讨论的完全相同的 NVLink 纵向扩展网络架构和多层弹性技术栈。通过利用一个经过验证的成熟平台,NVLink Fusion 帮助超大规模云服务商和 AI 原生企业提升性能、加快上市时间,并集成当今 AI 工厂所需的可靠性。

确保规模化条件下毫不妥协的可靠性

当各组织为大规模 AI 和加速计算工作负载评估纵向扩展架构时,仅比较简单的带宽指标是不够的。真正的规模化需要对容错采取全栈方法。

NVLink 6 专为通过整体性的多层容错方法最大化 MTBI 而打造。从亚毫秒级物理层纠错和原生基于信用的流控,到解耦的管理平面和机架级可维护性,NVLink 提供了保持全球最复杂的 AI 工厂不间断运行所需的弹性。

进一步了解 NVIDIA Vera Rubin 平台NVLinkNVLink Fusion

或查看纵向扩展网络如何决定 AI 工厂的经济效益