返回 文章 学习 CMS 文章

NVIDIA BlueField-4 驱动代理式 AI 工厂的 Scale-In 网络基础设施

NVIDIA 发布 Scale-In 网络基础设施,以 BlueField-4 为核心,为代理式 AI 工厂提供加速的安全、存储和运维服务。

NVIDIABlueField-4Scale-In代理式AI
成长分 / 100 80 综合收获、行动、留存与影响

NVIDIA BlueField-4 驱动代理式 AI 工厂的 Scale-In 网络基础设施
为什么值得读了解代理式 AI 工厂对网络基础设施提出的新需求,以及传统云基础设施为何不再足够。

掌握 NVIDIA Scale-In 架构的组成、工作原理及其与 Scale-Up、Scale-Out 等支柱的协同关系。

关键洞察
  1. 代理式 AI 工厂需要专用加速的基础设施域,将南北向网络演进为统一的 Scale-In 域,以线速处理安全、存储和运维。
  2. BlueField-4 提供独立于主机的加速和卸载,结合 DOCA 和 Spectrum-X Ethernet,实现策略在硬件中执行,避免主机 CPU 瓶颈。
  3. Scale-In 与 Scale-Up、Scale-Out、Scale-Across、Context Memory 共同构成 AI 工厂的五大基础设施支柱,确保数据访问、存储、安全和运维与计算同步扩展。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:18222

传统云基础设施是为可预测的通用工作负载和标准接口而设计的。代理式 AI 工厂将多样化的用户、代理、应用、数据源和存储系统连接到大规模加速计算,每台服务器带宽达数太比特,这使得专用 DPU 处理对于线速网络、存储和安全至关重要。NVIDIA 正在推出 Scale-In 网络基础设施,这是 NVIDIA AI 网络的第五大支柱,为保护、管理和运营代理式 AI 工厂带来专用加速。

Scale-In 将南北向网络演进为 AI 工厂的协调基础设施域。由 NVIDIA BlueField-4NVIDIA DOCA 提供支持,并通过 NVIDIA Spectrum-X Ethernet 连接,Scale-In 加速了保护整个 AI 栈的服务,并在 AI 工厂中传输应用、数据和存储流量。专用的、独立于主机的处理使这些基础设施服务脱离主机 CPU,有助于防止安全、数据访问和运营在 AI 计算扩展时成为瓶颈。其结果是构建出一个更安全、更高效的共享 AI 基础设施,随着需求增长,能够一致地访问 AI 服务和数据。

本文探讨 BlueField-4 架构,并解释 Scale-In 如何为代理式 AI 工厂提供安全访问、高性能数据移动、租户隔离、更简单的运营以及更可预测的性能。

Scale-In 加速南北向 AI 工厂基础设施

AI 工厂在不同规模下具有不同的基础设施需求:

Scale-Up:NVIDIA NVLink 将 GPU 统一为一致的加速器。Scale-Out:NVIDIA Spectrum-X Ethernet 和 NVIDIA Quantum InfiniBand 连接 AI 工厂中的服务器。Scale-Across:NVIDIA Spectrum-XGS Ethernet 连接分布式 AI 工厂。Context Memory:NVIDIA CMX 构建于面向 AI 原生存储的 NVIDIA STX 模块化基础之上,在工厂内提供共享 KV 缓存存储。Scale-In:NVIDIA BlueField-4、NVIDIA DOCA 和 NVIDIA Spectrum-X Ethernet 加速 AI 计算周边的访问、安全、数据移动和基础设施运营。

南北向网络提供进出数据中心的访问路径,将用户、应用、数据源、存储系统和服务连接到各个系统。传统云数据中心围绕软件定义基础设施、可组合性和弹性构建这些网络,因此资源和访问可以随着需求变化进行配置和扩展。

代理式 AI 提高了对该基础设施的需求。软件定义网络、可组合性和弹性仍然必不可少,但已不再足够。AI 工厂将大规模加速计算与数量不断增长的用户、代理、应用、企业数据源和存储系统汇聚在一起,所有这些都以大规模方式持续交互。

基础设施必须作为 AI 工厂的一部分进行加速和协同设计。安全、多租户网络、数据和存储访问以及基础设施运维不能仅依赖运行在通用主机 CPU 上的软件,也不能作为独立管理的层来运行。这些功能必须作为一个统一的基础设施域协同工作,使运维人员能够对 AI 工厂中的访问、数据移动、安全、配置和可观测性进行一致的控制。

Scale-In 通过将南北向访问演进为 AI 工厂中统一的加速基础设施域来满足这些需求。BlueField-4 提供独立于主机的加速和卸载,DOCA 提供用于编程和运维基础设施服务的统一模型,Spectrum-X 以太网在 Scale-In 访问路径上提供高性能以太网连接,包括外部存储和数据源。它们共同使运维人员能够对支持加速计算和数据存储的基础设施中的访问、数据移动、安全、配置和可观测性进行一致的控制。

架构图展示了 AI 计算系统的四个互连维度:Scale-Up 通过 CX(ConnectX)和 BF(BlueField)适配器连接多个 GPU;Scale-Out 通过顶层网络结构跨机架连接 GPU 节点;Scale-Across 将连接扩展到跨排和跨建筑;Scale-In 通过共享网络平面集成周边基础设施——包括 Agentic CPU、Agentic Storage、云服务、云安全、WAN 接入和数据中心编排。

图 1. Scale-Up、Scale-Out 和 Scale-Across 扩展计算连接,Scale-In 连接、保护、配置和观测计算域周边的基础设施

AI 工厂依赖互补的存储基础设施来持久化数据和推理上下文。Scale-In 提供对 AI 原生存储的高性能访问,包括用于训练、推理和分析的 AI 工厂存储,以及用于检索和多模态索引的企业 AI 数据系统。另外,CMX 为工厂内的共享 KV 缓存和可复用推理状态提供 Pod 级存储。BlueField-4 作为 Scale-In 的基础设施处理器,并单独作为 CMX 的数据和存储处理器。Scale-In 将 AI 工厂和企业数据连接到 AI 计算,而 CMX 保存和共享上下文以实现更快、更高效的推理。

这五大基础设施支柱共同满足 AI 工厂中的不同需求。只有当数据访问、存储、网络安全和运维与 GPU、机架和数据中心同步扩展时,扩展 GPU、机架和数据中心才能带来价值。

BlueField-4 为 Scale-In 基础设施提供动力

BlueField-4 在 GPU 服务器、代理式 CPU 系统、AI 工厂存储系统和云服务中加速横向扩展(Scale-In)服务。在 NVIDIA Vera Rubin NVL72 中,NVIDIA ConnectX-9 SuperNIC 通过横向扩展(Scale-Out)网络承载租户工作负载流量,而 BlueField-4 则运行并加速连接、保护和管理每台服务器的基础设施服务。BlueField-4 为运营商提供了一个独立于租户主机的独立基础设施处理域,他们可以在其中管理安全策略、服务状态和遥测数据,而无需依赖主机 CPU 或消耗其资源。

NVIDIA BlueField Astra 将可信控制从南北向访问扩展到东西向横向扩展(Scale-Out)架构中。Astra 为服务提供商提供了一个统一的、独立于主机的控制点,用于跨两个域进行配置、租户隔离和网络策略管理。BlueField-4 安装和更新策略并监控遥测数据,而 ConnectX-9 则直接在数据路径中执行这些策略。这种闭环在横向扩展(Scale-In)和横向扩展(Scale-Out)之间提供了一致的控制,而无需将设备管理置于租户主机中。

BlueField-4 将可编程控制平面处理与加速数据路径处理相结合。软件做出基础设施决策,而内联引擎在本地执行这些决策,无需将工作返回给主机 CPU。这种设计使得策略能够在整个工厂范围内协调,并以线速在本地执行。表 1 总结了主要组件如何支持这种处理模型。

组件 作用 优势
64 核 NVIDIA Grace CPU 运行策略、配置、遥测和基础设施编排软件 提供比其前代产品多 6 倍的计算能力,使多个基础设施服务能够并发运行
内联加速引擎 处理数据包、RDMA、存储协议、加密、防火墙规则和策略执行 以高达 800 Gb/s 的速度处理操作,同时减轻 Grace CPU 和主机 CPU 的处理负担
LPDDR5X 内存子系统 为基础设施软件提供数据和服务状态 提供高内存带宽和节能运行,而不会造成内存瓶颈
PCIe Gen6 主机连接 将 BlueField-4 连接到主机服务器 在主机和横向扩展(Scale-In)基础设施处理域之间提供高带宽路径
800 Gb/s 网络接口 将服务器连接到横向扩展(Scale-In)架构 支持高吞吐量访问、安全、数据移动和存储流量

表 1. BlueField-4 组件在横向扩展(Scale-In)处理路径中平衡控制平面处理、数据路径加速、内存访问、主机 I/O 和网络带宽。

与 BlueField-3 相比,BlueField-4 提供 4 倍的内存带宽和 2 倍的网络带宽。这种额外的容量支持更多并发服务、更大的策略和遥测数据集,以及更高的流量处理和安全吞吐量。

NVIDIA DOCA 编程横向扩展(Scale-In)服务

NVIDIA DOCA 将 BlueField-4 的硬件加速器转化为可编程、可部署的 Scale-In 服务。生产就绪的容器化 DOCA 微服务可直接在 BlueField-4 上运行,而 DOCA 库和 SDK 让开发者能够为自定义服务使用加速的网络、安全、存储和遥测能力。DOCA Flow 对硬件数据包处理流水线进行编程,DOCA PCC 支持可编程的拥塞行为,DOCA Telemetry 暴露设备与服务健康状况,DOCA Platform Framework(DPF)管理配置、部署与更新。BlueField-4 的多服务架构与原生服务功能链将每个流量流引导通过所需的服务序列。这些能力为 Scale-In 提供了统一的软件模型,用于在 BlueField-4 系统上运营服务,而无需管理各自独立的服务器流水线。

NVIDIA Spectrum-X Ethernet 连接 Scale-In 网络

NVIDIA Spectrum-X Ethernet 在 Scale-In 接入路径(包括外部存储)上提供高性能网络。BlueField-4 在每个系统上处理基础设施服务,而 Spectrum-X Ethernet 承载 AI 工厂与其周围的用户、应用、数据源、服务和外部存储之间的流量。Spectrum-X Ethernet 在大规模下解决负载均衡冲突与拥塞,提升资源利用率,帮助维持高有效带宽,并隔离并发流量,使接入流与存储流获得更一致、可预测的性能。

BlueField-4 DPU、DOCA 微服务和 Spectrum-X Ethernet 网络与 NVIDIA Vera Rubin 协同设计,使处理器性能、内存带宽、PCIe 连接、网络带宽、加速和软件能够彼此保持同步。它们共同提供一条 Scale-In 路径,在不消耗分配给 AI 工作负载的资源的情况下处理传输、服务处理和控制。

代理式 AI 工厂的关键 Scale-In 用例

代理式 AI 工厂必须安全地共享加速基础设施,为其提供企业数据,使系统上线,并持续监控性能。以下用例展示了 BlueField-4 加速与 DOCA 服务如何满足这些生产需求。

构建隔离的 AI 工厂虚拟私有云

AI 工厂虚拟私有云(VPC)在共享物理基础设施上隔离租户与应用流量。DOCA Host-Based Networking(HBN)在 BlueField-4 上加速南北向三层路由与多租户隔离。DOCA Flow 对流量分类与访问控制规则进行编程,而 DOCA 加速的 Open vSwitch(OVS-DOCA)在东西向接口上应用相应策略。BlueField Astra 将同一 VPC 策略扩展到东西向 Scale-Out 接口,因此一个策略模型同时管理接入流量与 Scale-Out 流量。

在 Vera Rubin 中,这一协同模型覆盖 7.2 Tb/s 的聚合接口带宽,包括南北向 BlueField-4 路径上的 800 Gb/s,以及每个计算托盘四条 1.6 Tb/s 的东西向路径。这在接入流量与 Scale-Out 流量上实现一致的策略覆盖,而无需将所有东西向流量都路由通过 800 Gb/s 接口。运维人员集中配置隔离的 AI 工厂 VPC,同时租户继续使用加速网络。该架构提供类云的弹性、一致的隔离、更低的主机 CPU 开销,以及更高效地使用共享 AI 基础设施。

在芯片中实施安全策略

BlueField-4 将执行点置于硬件中,位于主机操作系统之外。租户软件无法禁用或绕过这些控制,同时卸载的安全处理可保留主机 CPU 周期并避免额外的软件跳转。BlueField-4 以线速加速威胁检测并执行网络、文件和对象访问策略。DOCA Argus 提供运行时威胁检测,DOCA Vault 执行文件访问策略,DOCA Flow 编程实现线速网络策略执行。BlueField Astra 协调每台服务器上不同网络之间的加密、隔离和策略。Astra 在南北向和东西向流量之间同步策略、遥测、密钥和执行,将特权安全控制保持在租户主机之外,为共享 AI 服务提供一致的保护,并为 AI 工作负载保留主机资源。

加速存储访问

Scale-In 将 AI 计算连接到来自外部存储的训练数据、模型资产、企业知识和应用数据。如果存储协议处理、存储虚拟化或数据移动无法跟上,GPU 将在拥有可用计算和 Scale-Up/Scale-Out 网络带宽的情况下等待数据。

BlueField-4 在专用基础设施上加速基于 RDMA 和 TCP 的 NVMe-oF、文件和对象存储协议、存储虚拟化以及数据移动。Spectrum-X 以太网提供跨越存储路径的 AI 优化以太网架构,其中拥塞管理和性能隔离有助于在并发存储流中维持高有效带宽,存储吞吐量比现成以太网高出多达 1.45 倍。这减少了主机 CPU 开销,有助于保持 AI 计算持续运行,并为训练、检索和推理提供更一致的企业数据访问。此外部数据路径与 CMX 互补。

柱状图显示 BlueField-4 和 Spectrum-X 以太网 Scale-In 存储路径在 50 GB 文件传输中提供高达现成以太网 1.45 倍的吞吐量,测试使用 5 GB、10 GB 和 50 GB 文件大小。

图 2. 协同设计的 NVIDIA BlueField-4 和 Spectrum-X 以太网 Scale-In 存储路径提供高达现成以太网 1.45 倍的吞吐量

运行 AI 工厂控制平面

AI 工厂节点在运行 AI 工作负载之前必须进行配置、设置、保护和连接。BlueField-4 通过网络引导节点、配置网络和存储资源、启动服务器并加载主机操作系统。由于此控制平面独立于主机运行,它在租户软件启动之前建立策略并配置资源。DOCA Platform Framework 是一个 Kubernetes 原生编排框架,可将 BlueField DPU 作为 Kubernetes 节点进行配置、管理和扩展。它管理整个 AI 工厂 中的 DPU 发现、配置、服务部署和更新。这缩短了部署时间,提高了配置一致性,保留了主机 CPU 资源,并使新的 AI 容量更快上线。

观察和优化 AI 运营

大规模运营 AI 工厂需要持续掌握网络流量、存储访问、服务健康、性能与资源利用率。DOCA Telemetry 负责收集这些信息并将其导出至网络监控平台,而 DOCA 库则让可观测性提供商能够将同样的基础设施信号集成到自己的工具中。通过 BlueField-4 收集遥测数据,运营方可以保持独立于租户主机软件的可见性。当基础设施遥测扩展到 GPU 与网络利用率时,运营方就能识别与访问、流量、存储、策略执行或工作负载放置相关的约束。这种覆盖整个集群的可见性有助于在异常影响 AI 工作负载之前发现异常、定位瓶颈并解决事件。

Scale-In 将规模化算力转化为 AI 工厂性能

Scale-In 将南北向网络演进为面向数据访问、安全与运维的协调且加速的基础设施域。NVIDIA BlueField-4 提供网络加速、DOCA 程序并运行相关服务,而 Spectrum-X Ethernet 则在 Scale-In 访问与存储路径上提供高有效带宽和性能隔离。二者协同,帮助将规模化算力转化为安全且可运营的 AI 工厂平台。

后续步骤

探索 NVIDIA BlueField 平台以了解产品架构、规格与资源。- 进一步了解

NVIDIA Spectrum-X Ethernet以及NVIDIA DOCA 软件框架。- 开始为 BlueField 编程:

下载 NVIDIA DOCA,按照DOCA 入门指南操作,并构建 DOCA 示例。