返回 文章 apply CMS 文章

TensorRT Edge-LLM 在 Jetson AGX Thor 上完成 MLPerf Edge Agentic 基准测试,速度提升 6.4 倍

NVIDIA TensorRT Edge-LLM 通过 NVFP4 量化、KV 缓存复用和基于树的 MTP,在 Jetson AGX Thor 上实现边缘智能体推理 6.4 倍加速。

TensorRT Edge-LLMMLPerf边缘计算智能体 AI
成长分 / 100 79 综合收获、行动、留存与影响

TensorRT Edge-LLM 在 Jetson AGX Thor 上完成 MLPerf Edge Agentic 基准测试,速度提升 6.4 倍
为什么值得读了解边缘设备上运行智能体 AI 工作负载的最新性能基准和优化技术。

获取在 Jetson AGX Thor 上部署 Qwen3.6-27B 模型的详细步骤和配置。

关键洞察
  1. MLPerf Edge Agentic 基准测试衡量多轮智能体工作流,包含 20 段对话和 1,007 个生成轮次,输入长度可达约 23.5K token。
  2. TensorRT Edge-LLM 在 Jetson AGX Thor 上实现 52.33 token/s 的输出吞吐量,首 token 时间中位数 247.12 ms,BFCL 准确率 87.94%。
  3. NVFP4 量化将权重和激活压缩至 4 位浮点,KV 缓存使用 FP8,减少内存占用并提升解码性能。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:10053

AI 智能体正在从云端数据中心走向车辆、机器人和其他边缘设备。与只回答单个提示的聊天机器人不同,智能体需要按步骤序列逐步推进。它会选择工具、评估工具结果,并在不断变长的对话中持续推理。

这一工作流对边缘推理提出了新的要求。模型必须快速生成 token、高效处理长共享历史,并在有限的功耗和内存范围内生成有效的工具调用。

在 MLPerf Inference v6.1 Edge Agentic 基准测试中,NVIDIA TensorRT Edge-LLM 在单台 NVIDIA Jetson AGX Thor 开发者套件上运行了 Qwen3.6-27B。该系统实现了每秒 52.33 个 token,并在 24 分 36 秒内完成了性能工作负载的全部 1,007 轮,比 llama.cpp 参考提交的 2 小时 37 分钟快 6.4 倍。该结果采用了 NVFP4 量化、基于树的多 token 预测(MTP)以及 KV 缓存复用。

MLPerf 如何衡量端到端智能体 AI 性能

MLPerf Edge Agentic 分两个阶段衡量兼容 OpenAI 的模型端点:性能阶段和准确率阶段。

性能阶段会回放记录好的软件工程智能体轨迹。模型接收用户请求,生成工具调用,观察工具结果,并继续同一段对话。该工作负载包含 20 段对话和 1,007 个生成轮次。输入长度会随着轮次增长,并达到约 23.5K 个 token,因此长上下文处理是该测量中的重要组成部分。同时还会测量基于交并比(IoU)的行内准确率,以确保性能阶段正确运行智能体。

准确率阶段使用 Berkeley Function Calling Leaderboard(BFCL)v4 提示,仅限单轮且关闭推理,以在边缘设备上平衡准确率与评估时间。它评估模型是否选择了正确的函数、生成了有效参数,以及在不需要工具时是否避免调用工具。

MLPerf Edge Agentic 基准测试:一个包含 20 段对话、1,007 轮的性能数据集,其中工具结果会跨轮次累积到上下文中;以及一个包含 995 条提示的 BFCL v4 准确率数据集,用于评估正确的函数调用和无幻觉。

图 1. MLPerf Edge Agentic 工作负载衡量的是一个多轮循环,其中工具结果会在下一次模型请求之前加入对话

Jetson AGX Thor 上的 MLPerf Edge Agentic 基准测试结果

TensorRT Edge-LLM 提交在单台 Jetson AGX Thor 开发者套件上以 SingleStream 模式运行 Qwen3.6-27B,该套件配备 128 GB 统一内存,并处于 MAXN 功耗模式。

指标 结果
输出吞吐量 每秒 52.33 个 token
首 token 时间中位数 247.12 ms
每输出 token 时间中位数 14.68 ms
BFCL 总体准确率 87.94%

表 1. MLPerf v6.1 NVIDIA Edge Agentic 提交结果摘要

MLCommons Edge Agentic 示例 还发布了在 Jetson AGX Thor 上运行的 llama.cpp 参考结果,该结果使用 Qwen3.6-27B 和 Q4_K_M 量化,并在 2 小时 37 分钟内完成。TensorRT Edge-LLM 提交在 24 分 36 秒内完成该工作负载,即耗时减少 6.4 倍。

一张绿色和灰色的条形图,展示了 MLPerf Edge Agentic 性能工作负载在 NVIDIA Jetson AGX Thor 上的端到端完成时间,比较了智能体 AI 任务各阶段所花费的时间。

图 2. MLPerf Edge Agentic 性能工作负载在 Jetson AGX Thor 上的端到端完成时间

使用 NVFP4 量化加速 Qwen3.6-27B 推理

众所周知,边缘平台上的低批量 LLM 解码严重受限于 DRAM 带宽。减小权重和激活的大小可以降低内核的内存占用,从而提升解码性能。

提交的 Qwen3.6-27B 模型对权重和激活(包括语言模型头)使用 NVFP4,对 KV 缓存使用 FP8。NVFP4 是一种 4 位浮点格式,由 Jetson AGX Thor 中的 NVIDIA Blackwell GPU 支持。TensorRT Edge-LLM 使用优化内核来加速量化模型,同时保持 MLPerf 所要求的精度。

更小的模型表示还使 128 GB 统一内存中有更多空间可用于长上下文、推测解码状态和应用工作负载。开发者可以从已发布的、经过校准的 Qwen3.6-27B NVFP4 检查点开始。部署团队可以使用已发布的量化检查点,或在部署模型之前在任何开发系统上执行一次训练后量化。

在智能体轮次之间复用 KV 缓存

智能体轨迹中的每个新请求都包含大部分先前的对话,外加一个新的模型响应或工具结果。如果不进行复用,模型必须在每一轮重新预填充共享的历史记录。随着对话增长,成本也会增加。

TensorRT Edge-LLM 识别可复用的提示前缀,并恢复其缓存的注意力 KV 页。Qwen3.6 使用混合模型架构,因此运行时还会恢复正确继续执行所需的循环状态和部分 KV 页状态。然后它只预填充对话的新后缀。

KV 缓存和循环状态复用减少了整个智能体轨迹中重复的长上下文计算。此优化与基于树的 MTP 相辅相成:缓存复用降低了生成开始前的成本,而 MTP 减少了生成期间目标模型的步数。

在此工作负载上,约 96% 的提示 token 由热缓存提供服务。运行时在各轮次中仅预填充了总计 13.6M 提示 token 中的约 0.5M。

使用基于树的多 token 预测加速 LLM 推理

标准自回归解码每次模型调用生成一个 token。多 token 预测使用草稿模型预测多个未来 token,然后由目标模型一起验证。最近的模型通常具有与主模型一起训练和发布的官方 MTP 权重。

除了传统的线性 MTP,TensorRT Edge-LLM 还实现了基于树的 MTP 实现。运行时不是只保留一个预测的延续,而是将高概率候选组织成一棵树。目标模型在一次前向传递中验证候选,运行时接受匹配的路径。如果多个候选被接受,系统会将生成推进多个 token。

启动服务器时可以调整推测解码参数。MLPerf 服务器配置使用 8 个推测步、每个推测深度取前 2 个候选,以及一棵 16 节点的验证树。基于树的验证对函数调用很有用,因为工具名称、JSON 语法和常见参数结构通常是可以预测的,而多个分支可以为各个参数值保留可能的备选项。与采用 3 个推测步的线性 MTP 相比,基于树的 MTP 在此工作负载上可额外获得约 40% 的解码性能提升。

如何运行 MLPerf Edge Agentic 基准测试

本次提交所使用的实现可在 TensorRT Edge-LLM release/0.9.1-mlpinf 分支上获取。该分支包含模型导出设置、TensorRT 引擎构建命令、服务器配置以及 MLPerf 客户端配置

  1. 克隆 TensorRT Edge-LLM 并初始化其子模块。
git clone --branch release/0.9.1-mlpinf \
https://github.com/NVIDIA/TensorRT-Edge-LLM.git
cd TensorRT-Edge-LLM
git submodule update --init --recursive
  1. 下载校准后的 NVFP4 检查点。
huggingface-cli download \
centml/Qwen3.6-27B-NVFP4-W4A4-mlpinf \
--local-dir "$WORK/Qwen3.6-27B-NVFP4-W4A4-mlpinf"
  1. 按照 mlperf/README.md

构建 TensorRT Edge-LLM,使用 tree-MTP 接口导出检查点,并构建基础 TensorRT 引擎和草稿 TensorRT 引擎。

$VENV/bin/python -m tensorrt_edgellm.scripts.export \
"$WORK/Qwen3.6-27B-NVFP4-W4A4-mlpinf" \
"$WORK/onnx" \
--mtp-tree-base --skip-visual
  1. 启动兼容 OpenAI 的 TensorRT Edge-LLM 服务器。
export REPO="$PWD"
export VENV=/path/to/venv-edgellm-export
export WORK=/path/to/mlperf-artifacts
bash mlperf/serve_edgellm.sh
  1. 克隆 MLCommons 端点测试框架,安装其 BFCL 依赖项,更新 mlperf/config.yaml 中的模型和分词器路径,然后运行基准测试。
git clone https://github.com/mlcommons/endpoints.git
cd endpoints
python3.12 -m venv .venv
source .venv/bin/activate
pip install -e ".[dev,bfcl]"
inference-endpoint benchmark from-config \
--config "$REPO/mlperf/config.yaml"

所提供的配置以温度 0、随机种子 42、禁用推理以及并发数 1 来运行性能与准确率阶段。使用 --accuracy-only

选项可仅运行 BFCL 准确率阶段。有关数据集和客户端配置的更多信息,请参阅 MLCommons Edge Agentic 示例

有关所有提交的完整 MLPerf Inference v6.1 结果,请参阅 MLCommons 公告。有关服务器规模的 Vera Rubin 性能,请参阅 NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首秀中带来领先性能

致谢**本工作代表了 NVIDIA 的 TensorRT Edge-LLM、ModelOpt、Jetson 和 MLPerf 团队的贡献,尤其是 Zihao Kong、Xiang Guo、Yoco Xiao、Qikai Li 和 Ashwin Nanjappa。感谢 MLCommons 社区开发了 Edge Agentic 基准测试和端点测试框架。