随着大语言模型(LLM)推理越来越多地在个人、企业和受监管环境中处理敏感信息和专有模型上下文,数据必须在可信环境中进行处理。NVIDIA 机密计算(CC) 提供了一条使用内存加密的机密虚拟机(CVM)、机密 GPU 和加密的 NVIDIA NVLink 安全运行这些工作负载的途径。这使得可以在可信硬件上运行生产级 AI 推理。
诸如 NVIDIA TensorRT LLM 之类的推理框架,通过将框架级优化与 NVIDIA 加速计算相结合,提供一流的 AI 推理。然而,当这些框架在启用 CC 的环境中运行时,安全执行会改变内存移动、时序、调度和多 GPU 通信背后的假设。如果运行时不做适配,这些变化会引入性能开销。因此,保持高性能需要推理框架与机密计算环境协同优化。
对于在 NVIDIA Blackwell GPU 上评估机密推理的 AI 平台工程师,本文探讨了像 TensorRT LLM 这样的 AI 推理框架所使用的 CC 感知适配,以在考虑安全执行的同时帮助保持推理性能。本文提出了一套受控方法,团队可以将其应用于量化自身工作负载上的 CC 开销。
选择工作负载以暴露 CC 开销
工作负载特征决定了 CC 开销的可见程度。高请求量可以通过将停顿与其他工作重叠来摊销固定加密成本,从而使直接影响更难观察。
为了暴露这些影响,请选择具有长输入上下文、扩展输出生成和低并发度的工作负载。长上下文会在预填充(prefill)期间对数据移动造成压力,扩展生成会在解码(decode)期间放大每个 token 的小额 CC 开销,而低并发度则限制了跨并发请求隐藏这些成本的机会。
NVIDIA 性能工程团队在此处评估的工作负载中使用了这些特征。
| 参数 | 配置 |
|---|---|
| 模型 |
推理框架I/O 序列长度并发请求数并行度KV 缓存
表 1. 用于 CC 开启与 CC 关闭对比的工作负载配置## 通过受控的 CC 开启与 CC 关闭对比来测量 CC 开销
为了隔离 CC 的性能影响,请在两种条件下运行相同的工作负载:机密计算禁用(CC 关闭)和机密计算启用(CC 开启),并保持模型、硬件、框架版本、序列长度、并行度和并发度不变,以便 CC 状态是唯一变化的变量。
在每个并发级别下:
保留的输出吞吐量:100 x(CC 开启输出 tokens/s ÷ CC 关闭输出 tokens/s)延迟开销 每输出 Token 时间(TPOT):100 x(CC 开启 TPOT ÷ CC 关闭 TPOT − 1)
性能团队可以使用这些测量结果来量化在为目标工作负载启用 CC 时,CC 关闭基线保留了多少。NVIDIA 性能工程团队使用表 2 中总结的硬件和软件配置应用了这一对比。
| 组件 | 版本 / 详情 |
|---|---|
| 硬件 | 1 |
平台主机操作系统主机内核客户机操作系统客户机内核客户机 vCPU客户机 NUMANVIDIA 驱动VBIOSGPU 功耗限制CUDATensorRT LLMnvcr.io/nvidia/tensorrt-llm/release:1.3.0rc22NCCLOpenSSL编排
表 2. 用于 CC 开启和 CC 关闭运行的硬件和软件配置### 性能结果
如图 1 和图 2 所示,在并发 1–16 范围内,CC 开启时保留了 CC 关闭时输出 token 吞吐量的 96.1–98.2%,而平均 TPOT 保持在基线的 1.2% 至 4.3% 以内。

图 1. 并发 1–16 时 CC 开启相对于 CC 关闭基线的输出 token 吞吐量。CC 开启保留了基线吞吐量的 96.1% 至 98.2%
图 2. 并发 1–16 时启用 CC 相对于 CC 关闭基线的平均 TPOT。CC 开启引入了 1.2% 至 4.3% 的 TPOT 开销(TPOT 越低越好)## 识别并减少 CC 开销
NVIDIA Blackwell 机密计算架构引入了硬件强制安全路径,用于保护使用中的数据和工作负载。有关该架构的详细概述,请参阅基于硬件的 AI 安全,不会拖慢您的速度。
对于 TensorRT LLM 用户和框架开发者,以下细节展示了这些安全路径如何改变常见的运行时假设,以及 TensorRT LLM 如何适应以减少由此产生的性能开销。
调整主机到设备的数据移动
在 B200 CC 中,主机到设备的传输通过软件加密的反弹缓冲区,因为 GPU 无法直接访问受保护的 CVM 内存。这改变了推理框架预期的行为:固定内存不再提供其通常的异步传输优势,并且某些复制操作可能会阻塞调用线程。
主机到设备缓解措施:TensorRT LLM 使用 CC 感知的内存选择,为受影响的路径选择可分页内存,而不是无条件使用固定内存。设备到主机缓解措施:TensorRT LLM 将重复的 token 和采样数据回读移至异步工作线程,防止受保护的复制操作在解码期间阻塞主调度器。有关详细信息,请参阅TensorRT LLMPR #11573。
稳定内核自动调优器的计时
内核自动调优器通常使用 CUDA 事件来比较候选策略。在测试的 CC 配置中,CUDA 事件时间戳产生了不稳定的计时信号,这可能导致自动调优器选择较慢的策略。
缓解措施:TensorRT LLM 使用 GPU %globaltimer
用于 CC 下的 tactic 测量,同时将 CUDA events 保留在 CC 之外。详情请参见 TensorRT LLMPR #11657。
选择支持 CC 的多 GPU 通信
NVLS(NVLink SHARP)多播在 B200 CC 配置中不可用。在没有 NVLS 的情况下,NCCL_SYMMETRIC 无法提供其预期的多播优势,但在使用非多播集合通信路径之前,仍可能产生内存注册和跨 rank 同步开销。
缓解措施:面向 CC 的框架应检测 NVLS 的可用性,并选择能够针对给定消息大小、拓扑和工作负载特征最小化延迟的通信算法。
开始使用 NVIDIA 机密计算
NVIDIA 机密计算将硬件强制的保护扩展到机密虚拟机、NVIDIA Blackwell GPU 和加密 NVLink,在专有模型、企业上下文和敏感提示词被处理时对其进行保护。
机密计算并不会消除性能工程的需求——它反而使框架感知变得更加重要。借助 TensorRT LLM 针对安全数据移动、自动调优和多 GPU 通信的 CC 感知适配,机密 DeepSeek-R1 推理在八块 NVIDIA B200 GPU 上保留了超过 96% 的 CC 关闭时的输出 token 吞吐量,同时将每 token 延迟开销控制在 5% 以下。
随着各组织将私有推理投入生产,安全配置和推理优化应被视为同一个部署问题。启用机密计算,对环境的证明进行验证,并使用你打算实际服务的精确工作负载对 CC 开启和 CC 关闭进行基准测试。对于将私有推理投入生产的 AI 平台工程师和 TensorRT LLM 用户而言,安全配置和推理优化应被视为一项全栈工程工作。
要开始规划你的机密推理部署,请使用 NVIDIA 可信计算文档 并探索最新的 TensorRT LLM 功能和发行说明。要了解最新进展,请关注 NVIDIA 机密计算新闻。
致谢
我要感谢 Dan Hansen、Sheel Pethe、Samuel Mendoza-Jonas、Moein Ghaniyoun、Vidhya Krishnan、Avinash Ahuja、Laikh Tewari、Laura Martinez 和 Matheen Raza,感谢他们在这项工作中提供的工程贡献、技术指导、分析和深思熟虑的审阅。
