返回 文章 apply CMS 文章

NVIDIA 机密计算赋能高性能私有 AI 推理:TensorRT LLM 的 CC 感知优化实践

NVIDIA 通过 TensorRT LLM 的 CC 感知优化,在机密计算环境下实现近乎无损的高性能 AI 推理。

NVIDIA机密计算TensorRT LLMAI 推理
成长分 / 100 76 综合收获、行动、留存与影响

NVIDIA 机密计算赋能高性能私有 AI 推理:TensorRT LLM 的 CC 感知优化实践
为什么值得读了解机密计算如何在不显著牺牲性能的前提下保护敏感数据和专有模型。

获取 TensorRT LLM 针对 CC 环境的具体优化措施,包括内存移动、内核调优和多 GPU 通信。

关键洞察
  1. 机密计算通过内存加密的 CVM、机密 GPU 和加密 NVLink 提供可信执行环境,但会改变内存移动、时序、调度和多 GPU 通信的假设。
  2. 选择长输入上下文、扩展输出生成和低并发度的工作负载可以更明显地暴露 CC 开销。
  3. TensorRT LLM 通过 CC 感知的内存选择、异步回读、使用 GPU %globaltimer 替代 CUDA events 进行自动调优,以及检测 NVLS 可用性来减少性能开销。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:9711

随着大语言模型(LLM)推理越来越多地在个人、企业和受监管环境中处理敏感信息和专有模型上下文,数据必须在可信环境中进行处理。NVIDIA 机密计算(CC) 提供了一条使用内存加密的机密虚拟机(CVM)、机密 GPU 和加密的 NVIDIA NVLink 安全运行这些工作负载的途径。这使得可以在可信硬件上运行生产级 AI 推理。

诸如 NVIDIA TensorRT LLM 之类的推理框架,通过将框架级优化与 NVIDIA 加速计算相结合,提供一流的 AI 推理。然而,当这些框架在启用 CC 的环境中运行时,安全执行会改变内存移动、时序、调度和多 GPU 通信背后的假设。如果运行时不做适配,这些变化会引入性能开销。因此,保持高性能需要推理框架与机密计算环境协同优化。

对于在 NVIDIA Blackwell GPU 上评估机密推理的 AI 平台工程师,本文探讨了像 TensorRT LLM 这样的 AI 推理框架所使用的 CC 感知适配,以在考虑安全执行的同时帮助保持推理性能。本文提出了一套受控方法,团队可以将其应用于量化自身工作负载上的 CC 开销。

选择工作负载以暴露 CC 开销

工作负载特征决定了 CC 开销的可见程度。高请求量可以通过将停顿与其他工作重叠来摊销固定加密成本,从而使直接影响更难观察。

为了暴露这些影响,请选择具有长输入上下文、扩展输出生成和低并发度的工作负载。长上下文会在预填充(prefill)期间对数据移动造成压力,扩展生成会在解码(decode)期间放大每个 token 的小额 CC 开销,而低并发度则限制了跨并发请求隐藏这些成本的机会。

NVIDIA 性能工程团队在此处评估的工作负载中使用了这些特征。

参数 配置
模型

推理框架I/O 序列长度并发请求数并行度KV 缓存

表 1. 用于 CC 开启与 CC 关闭对比的工作负载配置## 通过受控的 CC 开启与 CC 关闭对比来测量 CC 开销

为了隔离 CC 的性能影响,请在两种条件下运行相同的工作负载:机密计算禁用(CC 关闭)和机密计算启用(CC 开启),并保持模型、硬件、框架版本、序列长度、并行度和并发度不变,以便 CC 状态是唯一变化的变量。

在每个并发级别下:

保留的输出吞吐量:100 x(CC 开启输出 tokens/s ÷ CC 关闭输出 tokens/s)延迟开销 每输出 Token 时间(TPOT):100 x(CC 开启 TPOT ÷ CC 关闭 TPOT − 1)

性能团队可以使用这些测量结果来量化在为目标工作负载启用 CC 时,CC 关闭基线保留了多少。NVIDIA 性能工程团队使用表 2 中总结的硬件和软件配置应用了这一对比。

组件 版本 / 详情
硬件 1

平台主机操作系统主机内核客户机操作系统客户机内核客户机 vCPU客户机 NUMANVIDIA 驱动VBIOSGPU 功耗限制CUDATensorRT LLMnvcr.io/nvidia/tensorrt-llm/release:1.3.0rc22NCCLOpenSSL编排

表 2. 用于 CC 开启和 CC 关闭运行的硬件和软件配置### 性能结果

如图 1 和图 2 所示,在并发 1–16 范围内,CC 开启时保留了 CC 关闭时输出 token 吞吐量的 96.1–98.2%,而平均 TPOT 保持在基线的 1.2% 至 4.3% 以内。

水平配对条形图,比较并发 1、2、4、8 和 16 时 CC 关闭与 CC 开启的输出 token 吞吐量。CC 关闭以深灰色归一化为 100%,CC 开启以绿色显示,分别保留 98.2%、98.0%、96.1%、96.8% 和 96.8%。

图 1. 并发 1–16 时 CC 开启相对于 CC 关闭基线的输出 token 吞吐量。CC 开启保留了基线吞吐量的 96.1% 至 98.2%水平配对条形图,比较并发 1、2、4、8 和 16 时 CC 关闭与 CC 开启的平均 TPOT。CC 关闭以深灰色归一化为 100%。CC 开启以 NVIDIA 绿色显示,分别为 101.2%、103.2%、104.3%、103.5% 和 103.1%。测得的 CC 开启 TPOT 值为 3.225、4.571、6.658、10.759 和 18.039 毫秒。较低的值表示更好的延迟。

图 2. 并发 1–16 时启用 CC 相对于 CC 关闭基线的平均 TPOT。CC 开启引入了 1.2% 至 4.3% 的 TPOT 开销(TPOT 越低越好)## 识别并减少 CC 开销

NVIDIA Blackwell 机密计算架构引入了硬件强制安全路径,用于保护使用中的数据和工作负载。有关该架构的详细概述,请参阅基于硬件的 AI 安全,不会拖慢您的速度

对于 TensorRT LLM 用户和框架开发者,以下细节展示了这些安全路径如何改变常见的运行时假设,以及 TensorRT LLM 如何适应以减少由此产生的性能开销。

调整主机到设备的数据移动

在 B200 CC 中,主机到设备的传输通过软件加密的反弹缓冲区,因为 GPU 无法直接访问受保护的 CVM 内存。这改变了推理框架预期的行为:固定内存不再提供其通常的异步传输优势,并且某些复制操作可能会阻塞调用线程。

主机到设备缓解措施:TensorRT LLM 使用 CC 感知的内存选择,为受影响的路径选择可分页内存,而不是无条件使用固定内存。设备到主机缓解措施:TensorRT LLM 将重复的 token 和采样数据回读移至异步工作线程,防止受保护的复制操作在解码期间阻塞主调度器。有关详细信息,请参阅TensorRT LLMPR #11573

稳定内核自动调优器的计时

内核自动调优器通常使用 CUDA 事件来比较候选策略。在测试的 CC 配置中,CUDA 事件时间戳产生了不稳定的计时信号,这可能导致自动调优器选择较慢的策略。

缓解措施:TensorRT LLM 使用 GPU %globaltimer

用于 CC 下的 tactic 测量,同时将 CUDA events 保留在 CC 之外。详情请参见 TensorRT LLMPR #11657

选择支持 CC 的多 GPU 通信

NVLS(NVLink SHARP)多播在 B200 CC 配置中不可用。在没有 NVLS 的情况下,NCCL_SYMMETRIC 无法提供其预期的多播优势,但在使用非多播集合通信路径之前,仍可能产生内存注册和跨 rank 同步开销。

缓解措施:面向 CC 的框架应检测 NVLS 的可用性,并选择能够针对给定消息大小、拓扑和工作负载特征最小化延迟的通信算法。

开始使用 NVIDIA 机密计算

NVIDIA 机密计算将硬件强制的保护扩展到机密虚拟机、NVIDIA Blackwell GPU 和加密 NVLink,在专有模型、企业上下文和敏感提示词被处理时对其进行保护。

机密计算并不会消除性能工程的需求——它反而使框架感知变得更加重要。借助 TensorRT LLM 针对安全数据移动、自动调优和多 GPU 通信的 CC 感知适配,机密 DeepSeek-R1 推理在八块 NVIDIA B200 GPU 上保留了超过 96% 的 CC 关闭时的输出 token 吞吐量,同时将每 token 延迟开销控制在 5% 以下。

随着各组织将私有推理投入生产,安全配置和推理优化应被视为同一个部署问题。启用机密计算,对环境的证明进行验证,并使用你打算实际服务的精确工作负载对 CC 开启和 CC 关闭进行基准测试。对于将私有推理投入生产的 AI 平台工程师和 TensorRT LLM 用户而言,安全配置和推理优化应被视为一项全栈工程工作。

要开始规划你的机密推理部署,请使用 NVIDIA 可信计算文档 并探索最新的 TensorRT LLM 功能和发行说明。要了解最新进展,请关注 NVIDIA 机密计算新闻

致谢

我要感谢 Dan Hansen、Sheel Pethe、Samuel Mendoza-Jonas、Moein Ghaniyoun、Vidhya Krishnan、Avinash Ahuja、Laikh Tewari、Laura Martinez 和 Matheen Raza,感谢他们在这项工作中提供的工程贡献、技术指导、分析和深思熟虑的审阅。