AI 智能体从根本上改变了推理工作负载的复杂性。到目前为止,业界一直难以制定一个标准来衡量推理系统在这些条件下的性能。Artificial Analysis AgentPerf (AA-AgentPerf) 提供了业界首个多供应商开放基准测试,对代表真实世界 AI 智能体 编码任务的轨迹进行剖析。
本文解释了 AA-AgentPerf 如何为衡量智能体工作负载性能设定新标准,以及 NVIDIA 极致协同设计如何帮助实现比上一代高达 20 倍的智能体编码性能提升。
什么是 AA-AgentPerf?
AA-AgentPerf 是由 Artificial Analysis 创建的硬件基准测试,用于衡量推理系统在满足预定义的、特定于模型的性能服务等级目标 (SLO) 层级的同时,可以支持的并发 AI 智能体数量。SLO 定义为输出令牌速度和首令牌时间 (TTFT) 的特定阈值。基准测试结果按每个加速器和每兆瓦进行归一化,以便在不同硬件配置之间进行比较。

图 1. AA-AgentPerf 硬件基准测试衡量并行运行多个 AI 智能体的吞吐量和效率
衡量具有代表性的智能体编码性能
智能体工作负载的独特之处在于,LLM 驱动的决策通常会产生非确定性的请求和工具调用序列。衡量智能体性能最困难的部分是准确地在具有代表性的智能体轨迹中捕捉这种非确定性——智能体从任务开始到结束所经历的动作、决策和观察的完整序列(图 2)。

图 2. 从用户请求到最终答案的智能体轨迹AA-AgentPerf 通过测量 GPU 在预录的、交织推理和工具使用的智能体编码轨迹上的性能,同时使用具有代表性的 CPU 工具调用性能基线模拟轮次间延迟,来捕捉这一点。这些轨迹围绕解决多个用例、12 种以上编程语言以及前沿模型响应的公共代码仓库中的问题而构建。除了对轨迹的严格定义外,Artificial Analysis 团队还:
- 利用请求的代表性缓存、输入和输出序列长度,范围从5K到131K,平均值约为27K。
- 将工具调用映射到代理编码工作流中的代表性CPU端任务,并在中位延迟时间为1秒的分布上模拟工具调用。然后将相同的CPU工具调用基线应用于所有测试的系统。
- 保持测试集私有,以防止针对基准测试的优化。
AA-AgentPerf 测试与测量方法
AA-AgentPerf 框架测量推理系统在满足SLO要求的情况下可以支持的并发代理数量(图3)。在发布时,该基准测试专注于在多个SLO层级上测试DeepSeek-V4-Pro,这些层级源自Artificial Analysis无服务器API基准测试数据。这确保了基准测试反映了当前生产提供商中观察到的服务质量水平。

图3. SLO阈值限制了在目标速度下可服务的用户数量在基准测试运行期间,AA-AgentPerf向GPU发送数千个并发请求,这些请求来自其预录的代理轨迹数据集。为确保每次运行的独立性,在每个轨迹阶段开始时添加动态前缀。在整个轨迹中严格执行SLO阈值,并将满足这些要求的最高并发级别记录为给定SLO的官方基准测试结果(图3)。然后,此过程在多个SLO层级上重复,以捕获不同的用户体验目标(表1)。
模型 | SLO层级 | P25输出速度(令牌/秒) | P95 TTFT(秒) |
DeepSeek-V4-Pro | SLO #1 | 30 | 10 |
SLO #2 | 100 | 5 | |
SLO #3 | 300 | 3 |
表1. AA-AgentPerf DeepSeek-V4-PRO测试的SLO层级和TTFT要求## 如何解读AA-AgentPerf结果
AA-AgentPerf的核心指标是每兆瓦运行时功率——这是表示数据中心规模性能的实用归一化方法。表2概述了如何利用报告的性能来估计在给定功率预算下可支持的代理会话数量。
基准测试 | 指标值 | NVIDIA GB300 NVL72 | NVIDIA H200 |
每MW并发代理数 | 能效:系统在给定功率预算下可支持的活跃代理数量 | 61.4K | 2.6K |
每GPU并发代理数 | 硬件效率:每个GPU实现的服务容量 | 57.5 | 1.4 |
表2. 如何利用AgentPerf报告的指标来帮助旨在大规模支持代理应用的数据中心进行容量规划。数字反映了SLO=30配置下的AA-AgentPerf结果
在发布日,NVIDIA GB300 NVL72 每兆瓦支持的并发代理数比上一代NVIDIA H200 高出20倍(图4)。

图4. 在每秒20和60个token的服务水平目标下,NVIDIA GB300 NVL72每兆瓦支持的并发编码代理数远超H200,达到约20倍的代理容量这一性能凸显了GB300 NVL72如何在大规模代理编码工作负载中实现高效交付,从高效路由长期会话到保持混合专家模型(MoE)和GPU在众多并发代理会话中的充分利用。
SGLang、TensorRT LLM或vLLM:代理运行时应用WideEP和DeepEP等优化,将MoE专家执行分布到整个NVL72域,最大化有效批处理大小,并有效扩展到数千个代理。DeepGEMM和Mega MoE优化:MXFP4/MXFP8内核和融合MoE将NVLink通信与张量核心计算重叠,以提高推理和代码生成的token吞吐量。NVIDIA NVLink扩展域:GB300 NVL72将72个GPU连接到一个高带宽NVLink结构中,使每个GPU能够快速共享参数、KV缓存和中间结果——这对于快速、协调地执行代理编码系统至关重要。
展望未来:NVIDIA Vera Rubin平台
AA-AgentPerf确立了评估代理推理的标准,结果凸显了紧密集成的硬件和软件如何在并发性和效率上实现阶跃式提升。NVIDIA GB300 NVL72展示了高达20倍的代理编码性能提升。
NVIDIA Vera Rubin平台预计将通过利用50 PFLOPs的NVFP4计算并利用Vera CPU加速LLM工具调用,进一步提升这些优势,从而改善代理工作流的端到端性能、经济性和效率。
要了解更多关于代理工作负载为何对推理基础设施提出独特要求,以及NVIDIA Vera Rubin平台如何优化性能,请参阅通过极致协同设计应对代理系统日益增长的复杂性。
致谢
本工作得益于Jatin Gangani、Iman Tabrizian、Xiaoming Chen、Peiheng Hu、Taizhong Wu、Shichen Li、Manu Maheswari以及众多其他才华横溢的NVIDIA工程师的专业知识和工程贡献。