AI 智能体正在从云端数据中心走向车辆、机器人和其他边缘设备。与只回答单个提示的聊天机器人不同,智能体需要按步骤序列逐步推进。它会选择工具、评估工具结果,并在不断变长的对话中持续推理。
这一工作流对边缘推理提出了新的要求。模型必须快速生成 token、高效处理长共享历史,并在有限的功耗和内存范围内生成有效的工具调用。
在 MLPerf Inference v6.1 Edge Agentic 基准测试中,NVIDIA TensorRT Edge-LLM 在单台 NVIDIA Jetson AGX Thor 开发者套件上运行了 Qwen3.6-27B。该系统实现了每秒 52.33 个 token,并在 24 分 36 秒内完成了性能工作负载的全部 1,007 轮,比 llama.cpp 参考提交的 2 小时 37 分钟快 6.4 倍。该结果采用了 NVFP4 量化、基于树的多 token 预测(MTP)以及 KV 缓存复用。
MLPerf 如何衡量端到端智能体 AI 性能
MLPerf Edge Agentic 分两个阶段衡量兼容 OpenAI 的模型端点:性能阶段和准确率阶段。
性能阶段会回放记录好的软件工程智能体轨迹。模型接收用户请求,生成工具调用,观察工具结果,并继续同一段对话。该工作负载包含 20 段对话和 1,007 个生成轮次。输入长度会随着轮次增长,并达到约 23.5K 个 token,因此长上下文处理是该测量中的重要组成部分。同时还会测量基于交并比(IoU)的行内准确率,以确保性能阶段正确运行智能体。
准确率阶段使用 Berkeley Function Calling Leaderboard(BFCL)v4 提示,仅限单轮且关闭推理,以在边缘设备上平衡准确率与评估时间。它评估模型是否选择了正确的函数、生成了有效参数,以及在不需要工具时是否避免调用工具。

图 1. MLPerf Edge Agentic 工作负载衡量的是一个多轮循环,其中工具结果会在下一次模型请求之前加入对话
Jetson AGX Thor 上的 MLPerf Edge Agentic 基准测试结果
TensorRT Edge-LLM 提交在单台 Jetson AGX Thor 开发者套件上以 SingleStream 模式运行 Qwen3.6-27B,该套件配备 128 GB 统一内存,并处于 MAXN 功耗模式。
| 指标 | 结果 |
|---|---|
| 输出吞吐量 | 每秒 52.33 个 token |
| 首 token 时间中位数 | 247.12 ms |
| 每输出 token 时间中位数 | 14.68 ms |
| BFCL 总体准确率 | 87.94% |
表 1. MLPerf v6.1 NVIDIA Edge Agentic 提交结果摘要
MLCommons Edge Agentic 示例 还发布了在 Jetson AGX Thor 上运行的 llama.cpp 参考结果,该结果使用 Qwen3.6-27B 和 Q4_K_M 量化,并在 2 小时 37 分钟内完成。TensorRT Edge-LLM 提交在 24 分 36 秒内完成该工作负载,即耗时减少 6.4 倍。

图 2. MLPerf Edge Agentic 性能工作负载在 Jetson AGX Thor 上的端到端完成时间
使用 NVFP4 量化加速 Qwen3.6-27B 推理
众所周知,边缘平台上的低批量 LLM 解码严重受限于 DRAM 带宽。减小权重和激活的大小可以降低内核的内存占用,从而提升解码性能。
提交的 Qwen3.6-27B 模型对权重和激活(包括语言模型头)使用 NVFP4,对 KV 缓存使用 FP8。NVFP4 是一种 4 位浮点格式,由 Jetson AGX Thor 中的 NVIDIA Blackwell GPU 支持。TensorRT Edge-LLM 使用优化内核来加速量化模型,同时保持 MLPerf 所要求的精度。
更小的模型表示还使 128 GB 统一内存中有更多空间可用于长上下文、推测解码状态和应用工作负载。开发者可以从已发布的、经过校准的 Qwen3.6-27B NVFP4 检查点开始。部署团队可以使用已发布的量化检查点,或在部署模型之前在任何开发系统上执行一次训练后量化。
在智能体轮次之间复用 KV 缓存
智能体轨迹中的每个新请求都包含大部分先前的对话,外加一个新的模型响应或工具结果。如果不进行复用,模型必须在每一轮重新预填充共享的历史记录。随着对话增长,成本也会增加。
TensorRT Edge-LLM 识别可复用的提示前缀,并恢复其缓存的注意力 KV 页。Qwen3.6 使用混合模型架构,因此运行时还会恢复正确继续执行所需的循环状态和部分 KV 页状态。然后它只预填充对话的新后缀。
KV 缓存和循环状态复用减少了整个智能体轨迹中重复的长上下文计算。此优化与基于树的 MTP 相辅相成:缓存复用降低了生成开始前的成本,而 MTP 减少了生成期间目标模型的步数。
在此工作负载上,约 96% 的提示 token 由热缓存提供服务。运行时在各轮次中仅预填充了总计 13.6M 提示 token 中的约 0.5M。
使用基于树的多 token 预测加速 LLM 推理
标准自回归解码每次模型调用生成一个 token。多 token 预测使用草稿模型预测多个未来 token,然后由目标模型一起验证。最近的模型通常具有与主模型一起训练和发布的官方 MTP 权重。
除了传统的线性 MTP,TensorRT Edge-LLM 还实现了基于树的 MTP 实现。运行时不是只保留一个预测的延续,而是将高概率候选组织成一棵树。目标模型在一次前向传递中验证候选,运行时接受匹配的路径。如果多个候选被接受,系统会将生成推进多个 token。
启动服务器时可以调整推测解码参数。MLPerf 服务器配置使用 8 个推测步、每个推测深度取前 2 个候选,以及一棵 16 节点的验证树。基于树的验证对函数调用很有用,因为工具名称、JSON 语法和常见参数结构通常是可以预测的,而多个分支可以为各个参数值保留可能的备选项。与采用 3 个推测步的线性 MTP 相比,基于树的 MTP 在此工作负载上可额外获得约 40% 的解码性能提升。
如何运行 MLPerf Edge Agentic 基准测试
本次提交所使用的实现可在 TensorRT Edge-LLM release/0.9.1-mlpinf 分支上获取。该分支包含模型导出设置、TensorRT 引擎构建命令、服务器配置以及 MLPerf 客户端配置
- 克隆 TensorRT Edge-LLM 并初始化其子模块。
git clone --branch release/0.9.1-mlpinf \
https://github.com/NVIDIA/TensorRT-Edge-LLM.git
cd TensorRT-Edge-LLM
git submodule update --init --recursive
- 下载校准后的 NVFP4 检查点。
huggingface-cli download \
centml/Qwen3.6-27B-NVFP4-W4A4-mlpinf \
--local-dir "$WORK/Qwen3.6-27B-NVFP4-W4A4-mlpinf"
- 按照
mlperf/README.md
构建 TensorRT Edge-LLM,使用 tree-MTP 接口导出检查点,并构建基础 TensorRT 引擎和草稿 TensorRT 引擎。
$VENV/bin/python -m tensorrt_edgellm.scripts.export \
"$WORK/Qwen3.6-27B-NVFP4-W4A4-mlpinf" \
"$WORK/onnx" \
--mtp-tree-base --skip-visual
- 启动兼容 OpenAI 的 TensorRT Edge-LLM 服务器。
export REPO="$PWD"
export VENV=/path/to/venv-edgellm-export
export WORK=/path/to/mlperf-artifacts
bash mlperf/serve_edgellm.sh
- 克隆 MLCommons 端点测试框架,安装其 BFCL 依赖项,更新
mlperf/config.yaml中的模型和分词器路径,然后运行基准测试。
git clone https://github.com/mlcommons/endpoints.git
cd endpoints
python3.12 -m venv .venv
source .venv/bin/activate
pip install -e ".[dev,bfcl]"
inference-endpoint benchmark from-config \
--config "$REPO/mlperf/config.yaml"
所提供的配置以温度 0、随机种子 42、禁用推理以及并发数 1 来运行性能与准确率阶段。使用 --accuracy-only
选项可仅运行 BFCL 准确率阶段。有关数据集和客户端配置的更多信息,请参阅 MLCommons Edge Agentic 示例。
有关所有提交的完整 MLPerf Inference v6.1 结果,请参阅 MLCommons 公告。有关服务器规模的 Vera Rubin 性能,请参阅 NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首秀中带来领先性能。
致谢**本工作代表了 NVIDIA 的 TensorRT Edge-LLM、ModelOpt、Jetson 和 MLPerf 团队的贡献,尤其是 Zihao Kong、Xiang Guo、Yoco Xiao、Qikai Li 和 Ashwin Nanjappa。感谢 MLCommons 社区开发了 Edge Agentic 基准测试和端点测试框架。
