AI 已经改变了组织的运营方式,推动了前所未有的生产力和创新水平。然而,AI 的采用可能会因围绕数据隐私、数据主权以及如何在使用中或在与 AI 模型进行推理和交互期间保护数据的担忧而受到阻碍。NVIDIA 机密计算(CC)被设计为面向代理式 AI 时代的安全且高性能的解决方案,以安全地扩展任何模型。
CC 能够在主动推理期间保护企业数据和专有模型权重以及模型本身。在本文中,我们将提供 CC 的概述,并展示基准测试,表明其推理性能与未启用 CC 安全性的解决方案几乎相同(高达 98%)。
数据、代码和模型完整性
CC 提供了一层跨越芯片、互连和系统软件的安全层。其工作原理如下:

图 1. 机密计算提供数据和代码的完整性和机密性
硬件信任根
NVIDIA Blackwell GPU,包括 NVIDIA RTX PRO 6000、HGX B200 和 HGX B300,在设计时就将 CC 嵌入硬件中。HGX B200 和 HGX B300 GPU 通过 NVIDIA NVLink 加密支持跨多个 GPU(最多 8 个)的机密计算。在芯片层面,GPU 维护一个在制造时熔断的私有签名密钥,该密钥永远不会暴露给软件、固件或主机系统。该密钥是证明链的基础。
证明:执行前验证
在机密工作负载接收任何机密之前,它会经过远程证明。NVIDIA 远程证明服务(NRAS)会根据已知良好的参考完整性清单(RIM)验证签名的证据包——GPU 的硬件报告与 CPU TEE 测量值(AMD SEV-SNP 或 Intel TDX)相结合。
一旦机密虚拟机(CVM)处于经过验证的、未修改的状态,诸如模型解密密钥之类的机密就可以部署到 CVM 中。证明握手通常是一次性启动事件。一旦工作负载运行,证明不会为单个推理请求增加延迟。

图 2. 证明服务远程验证可信执行环境的身份、配置和完整性,并发布加密证明
优化机密计算中的 AI 推理性能
在 Blackwell GPU 上,CC 对 AI 推理性能的改变可能来自两个方面:
安全工作提交延迟:对于推理而言,安全工作提交延迟通常是更大的影响因素,并且由于加密和内核启动带来的额外开销,较小的工作单元受到的影响更大。增加每次 GPU 工作启动所执行的工作量,可以减少安全启动开销的影响。主机到设备(CPU 到 GPU)带宽降低:如果工作负载严重依赖将输入传输到 GPU,则性能将取决于维持 GPU 充分利用所需的带宽是否超过 CC 模式下可用的加密传输带宽。
若干创新优化了 CC 下的推理性能,包括:
CC 安全的自动调优计时:FlashInfer 在 CC 模式下用 GPU 全局计时器寄存器替代事件计时器,使自动调优器能够准确比较候选内核,并为每种形状选择最快的实现。异步 D2H 拷贝工作线程:SGLang 将每步的 token 回读移出调度器的关键路径。这有助于恢复计算/拷贝的重叠,因为在 CC 模式下,cudaMemcpyAsync 期间的许多主机到设备和设备到主机拷贝实际上会变为同步。分段 CUDA 图支持:SGLang 为预填充和混合批次添加了 CUDA 图重放,减少了在 CC 模式下被放大的内核启动开销。
NVIDIA 持续与推理框架的上游社区合作,以确保这些框架针对性能进行优化。
我们测量了 CC 在不同关键指标下的推理性能。以下是测试设置和测量结果的详细信息。
基准测试结果
在测试的所有工作负载配置中,启用 CC 模式在稳态推理期间产生的吞吐量和每输出 token 时间开销极小。
下表总结了在 Blackwell Ultra(HGX B300)上,模型 Qwen/Qwen3.5-397B-A17B-FP8 的 CC 吞吐量、TTFT、TPOT 开销
机密计算的相对性能
并发数 | ISL/OSL = 1024 / 1024 | ISL/OSL = 8192 / 1024 | ||
吞吐量/GPU (tok/s) | TPOT 中位数 (ms) | 吞吐量/GPU (tok/s) | TPOT 中位数 (ms) | |
Δ% 对比 OFF | Δ% 对比 OFF | Δ% 对比 OFF | Δ% 对比 OFF | |
4 | -2.0% | -1.6% | -3.5% | -3.6% |
8 | -2.6% | -2.4% | -2.8% | -2.9% |
16 | -5.3% | -4.9% | -2.8% | -3.0% |
32 | -6.3% | -7.8% | -1.0% | -0.9% |
64 | -6.2% | -6.8% | -2.3% | -2.4% |
128 | -7.5% | -8.1% | -3.5% | -3.5% |
256 | -4.6% | -4.1% | -3.6% | -3.7% |
表 1. 启用 NVIDIA 机密计算的相对性能影响
测试设置
基准测试:Qwen 3.5 397B-A17B 模型,FP8 精度环境:带 GPU 直通的虚拟机基线:机密计算关闭实验:机密计算开启
所有其他变量保持不变。
硬件配置
HGX B300 搭载 Blackwell Ultra。
软件栈
组件 | 版本 / 详情 |
平台 | Intel TDX |
主机操作系统 | Ubuntu 25.10 |
主机内核 | 6.17.0-20-generic |
客户机操作系统 | Ubuntu 24.04.4 LTS |
客户机内核 | 6.8.0-124-generic |
客户机 vCPU | 256 |
客户机 NUMA | 2 个节点 |
NVIDIA 驱动 | 595.71.05 |
VBIOS | FW 1.4.x [97.10.64.00.0C] |
GPU 功耗限制 | 1100.00 |
CUDA | 13.2 |
SGlang |
NCCLOpenSSLOrchestration表 2. 测试设置的软件配置
注意:请遵循此文档中描述的 CPU 功耗和 vCPU 绑定配置。
工作负载参数
每种配置都在一系列代表真实企业推理工作负载的条件下进行了测试:
输入/输出 token 长度:8192/1024、1024/1024批大小:4、8、16、32、64、128 和 256 个并发请求。推理框架(模式):SGLang(服务器)基线:不使用 --enable-symm-mem
收集的指标
每 GPU 输出吞吐量(tokens/秒/GPU)中位首 token 时间(TTFT)——从请求提交到生成首个 token 的延迟,单位为毫秒中位每输出 token 时间(TPOT)——稳态流式生成中每个 token 的生成延迟,单位为毫秒
前进路径
借助 CC 的硬件级安全性可保护敏感 AI 工作负载,同时保持生产 AI 工作负载所需的性能。
CC 为生产推理工作负载提供了更强的安全基础,且性能开销极小。在我们使用 SGLang 上的 Qwen 3.5 进行的评估中,我们在并发级别、输入序列长度和输出序列长度的扫描范围内观察到了这一点,证明组织可以保护其 AI 工作负载和数据,并遵守法规,而无需牺牲性能。
通过访问以下资源,加入 NVIDIA 及其合作伙伴,在 Blackwell 上使用 CC 保护您的 AI 工作负载。
资源
NVIDIA 机密计算文档NVIDIA Blackwell 架构白皮书NVIDIA GPU Operator 和容器工具包NVIDIA 远程证明服务 (NRAS)NIST SP 800-207 零信任架构HIPAA 安全规则 (HHS)GDPR 第 32 条 — 处理安全性
