AI 智能体的效果取决于它们接收到的上下文。即便拥有能力强大的模型和文档完善的 NVIDIA 库,智能体仍可能花费额外步骤寻找合适的工具、在死胡同里消耗 token,或在专门任务上举步维艰。技能(Skills)将指令、示例和工具指南打包起来,让智能体能够更快地从意图走向解决方案。为了衡量这些技能是否改善了智能体的轨迹和输出,NVIDIA 构建了一个面向智能体技能的开放评估层。
NVIDIA SkillEvaluator 是一个开源工具,通过静态检查以及在安装与不安装每项技能的情况下运行真实任务,来衡量技能对智能体表现的影响。NVIDIA 已验证技能是经过打包和签名的能力描述符,它们准确告诉智能体某个 NVIDIA 产品能做什么、何时调用它以及如何调用它。已验证的部分正是确定其已就绪的度量。
本文分享了对 30 多个 NVIDIA 产品中 300 多项已验证技能的首批基准测试结果。每项技能都在两个独立的测试框架上进行了评估。对于每个测试框架,技能提升(Skill Lift)都是通过比较安装技能与未安装技能时的运行得分来计算的。
NVIDIA 发布了面向 Claude Code、Codex 和 Cursor 的插件,同样的技能也可通过 Skills.sh、ClawHub 和 Hermes Hub 获取。
方法论:技能如何被评估
在技能发布之前,它要经过三个层级的评估。每一层回答不同的问题,且每一层都可以独立运行。
第 1 层——安全与结构: 运行静态检查,包括 schema 和 frontmatter 验证、质量评分、针对提示注入和数据外泄的安全扫描、密钥与 PII 检测、许可证检查以及脚本 lint。
第 2 层——独特性: 使用嵌入相似度来识别单个技能内部的重复指导,以及整个技能目录中的覆盖重叠。
第 3 层——实时评估: 在隔离沙箱中,让智能体针对生成的任务运行实时评估,一次安装技能,一次不安装,并测量差异。
第 3 层:实时评估如何运作
第 3 层评估使用 Harbor,这是一个用于在可重复、隔离环境中运行智能体评估的开源框架。SkillEvaluator 负责处理 Harbor 的设置。它将评估用例转化为任务,在沙箱中运行智能体,收集结果,并计算技能的影响。
每个结果都来自受控比较。对于每个评估用例,智能体测试框架会运行两次:一次安装已验证技能,一次不安装。每次运行都在各自独立的隔离沙箱中执行,使用相同的提示、模型、任务输入和评分标准。在每个测试框架内,唯一的实验变量就是是否安装了该技能。
这种比较会在两个智能体测试框架上重复进行。安装技能与未安装技能得分之间的差异就是该技能的贡献,以分数形式报告为技能提升(Skill Lift)。
一个简单的示例
首先,为某项技能生成一个评估数据集:
skillevaluator create-eval-dataset ./my-skill --full
这会创建 evals/evals.json。每个用例包含一个 ID、提示词和预期输出,以及可选断言。使用 –full 时,数据集会包含显式、隐式、上下文和负向用例。
审查完这些用例后,运行实时对比:
skillevaluator tier3 evaluate ./my-skill \
--agents codex \
--env-mode docker
SkillEvaluator 将用例转换为 Harbor 任务包,分别在启用和不启用技能的情况下运行每个用例,对两次运行进行评分,并生成分数和 Skill Lift。这为用户保持了工作流的简洁性,同时由 Harbor 管理底层的执行与隔离。完整工作流请参阅 Tier 3 Live Evaluation 文档。
实时评估结果
本节中的所有数据均使用 commit 738d79e 处的 benchmarks.json 的 2026 年 8 月 12 日快照。分数是对已发布的技能–测试框架结果进行宏平均得出的,每个技能–测试框架组合权重相同。Skill Lift 是启用技能时的分数减去未启用技能时的分数,以分值为单位。该目录会持续评估,因此当前数据仍可在 nvidia/skills 仓库的 benchmarks.json 中获取。
未启用技能的基线评估结果
在基准快照中,以下分数代表使用 Codex 和 Claude Code 评估的 NVIDIA/skills 仓库中各技能在未启用技能运行时的平均分。它们展示了智能体在未安装相关技能的情况下执行相同任务的表现。
表 1 定义了五个评分维度。在 Correctness、Discoverability、Effectiveness 和 Efficiency 上,平均基线分数在 100 分中处于 39 到 46 之间,表明仍有很大的改进空间。Security 是例外,平均基线分数为 97。对于 Security,主要目标是验证安装技能不会引入回归。
| 维度 | 衡量内容 | 未启用技能时的基线分数(满分 100) |
|---|---|---|
| Correctness | 最终答案是否正确? | 46 |
| Discoverability | 相关技能是否在需要时加载,在不需要时保持不加载? | 42* |
| Effectiveness | 智能体是否达成用户目标并遵循预期工作流? | 39 |
| Efficiency | 智能体是否在没有多余步骤或冗余工具调用的情况下达成目标? | 43* |
| Security | 运行是否避免不安全操作、机密泄露和未授权访问 | 97* |
表 1. 五个评分维度以及智能体在未加载技能时的表现。星号说明见下方文字#### 已知限制
Correctness、Effectiveness 和 Security 衡量运行的结果,因此它们的基线展示了智能体在未安装相关技能时能够做到什么。
Discoverability 和 Efficiency 还衡量技能的使用方式:智能体是否找到它、在行动前阅读它,以及是否避免不必要的步骤。没有该技能时,这些操作不可用。然而,智能体仍可因有效使用工具、干净执行以及在不相关任务中正确保持技能不加载而获得分数。这些评分组成部分有助于解释为什么基线约为 42 和 43,而不是零。
大多数技能按每个任务单次尝试进行评估。在已发布结果的技能中,85% 运行了一次尝试,15% 运行了两次。实时智能体运行在不同次之间会有差异,因此单个技能分数会波动。目录范围内的平均值汇总了数千次试验,但本文未报告置信区间。
启用技能与未启用技能的评估结果
相同的评估使用了 NVIDIA/skills GitHub 仓库中的技能。表 2 显示了 Codex 和 Claude Code 中带技能的平均得分以及相对于无技能基线的技能提升。
经过验证的技能在两种被评估的测试框架中都提升了智能体的表现,其中在正确性、可发现性、有效性和效率方面的提升最大。技能提升以点数报告,而非百分比变化。安全性在基线时已经很高,因此其测得的提升较小。可发现性和效率应被解读为技能在被激活并被正确使用时的指标。
| 维度 | 无技能得分 | 带技能得分 | 技能提升 |
|---|---|---|---|
| 正确性 | 46 | 87 | +41 |
| 可发现性 | 42 | 82 | +40 |
| 有效性 | 39 | 78 | +39 |
| 效率 | 43 | 78 | +35 |
| 安全性 | 97 | 98 | +1 |
| 所有维度(平均) | — | — | +31 |
| 不含安全性(平均) | — | — | +39 |
表 2. 经过验证的技能的平均技能提升在正确性和有效性——这两种条件下一致测量的两个维度——上,平均得分从 46 升至 87,从 39 升至 78,分别提升了 41 和 39 点。这些得分并非通过概率估计;它们显示的是在被评估的专门任务上更高的平均表现。
可发现性和效率的技能提升值分别为 40 和 35 点。两者都是针对技能本身进行评分的,因此应将其解读为智能体在安装后正确激活并使用相关经过验证的技能的证据,而非对无辅助智能体行为的衡量。这一特性很重要:环境中的每个技能都在争夺智能体的注意力,而一个在不相关时被加载的技能可能会降低智能体的表现。
按测试框架划分的技能提升
| 范围 | Claude Code | OpenAI Codex |
|---|---|---|
| 所有维度 | +34 | +29 |
| 不含安全性 | +42 | +36 |
表 3. 技能提升因测试框架而异。Claude Code 在所有维度上显示出更高的技能提升两种测试框架都显示出持续且有意义的提升。鉴于默认系统提示、上下文处理和工具调用实现的不同,它们之间的差异是意料之中的。经过验证的技能提供了两种测试框架自身都无法产生的结构化基础。
合作伙伴试点使用 SkillEvaluator
OpenClaw 正在为 ClawHub 上的官方组织试点 SkillEvaluator。该集成运行第 3 层评估,并在 Evals 标签页中显示带技能和无技能的结果,使开发者能够在发现和采用技能的地方查看评估信号。
Nous Research 在 Hermes Agent 中测试了 SkillEvaluator,并在技能安装流程中通过 SkillSpector 进行可选咨询扫描。该集成检查 PII、Unicode 走私、脚本 lint、许可证和安全问题,并在安装前呈现文件行级发现。该工作流覆盖了 29 个通过的测试,每次技能扫描大约需要 1.4-1.5 秒。
主要发现
评估结果突出了团队构建和测试智能体技能的三项实用发现。
更好的评估数据集产生更好的技能
清晰定义重要任务、预期输出和范围外请求的团队会产生更清晰的评估信号,而且这发生在任何智能体运行之前。技能只能按其评估集对工作的描述精度来衡量。
产品比智能体更重要
技能提升在不同产品之间的差异远大于在不同测试框架之间的差异。Claude Code 和 Codex 平均相差约 5 个百分点。但各产品的技能提升范围大约从 +2 到 +46。领域、任务和评估设计比测试框架更重要。
令牌节省并非自动实现
SkillEvaluator 将令牌使用量与效率分开追踪。在两个单次尝试的示例中,来自 NVIDIA 已验证技能仓库 的一个技能 jetson-optimize-memory
将令牌从 617,306 减少到 142,540(76.9%),执行时间从 474.9 秒减少到 220.0 秒(53.7%)。相反,cuopt-install
将令牌从 25,227 增加到 55,582(120.3%),执行时间从 34.0 秒增加到 41.1 秒(20.8%),从而识别出进一步优化的机会。SkillEvaluator 揭示了某个技能是提高了令牌和执行效率,还是需要进一步优化。
开始使用
要开始使用,请访问 SkillEvaluator 文档,或从 GitHub 上的 NVIDIA 已验证技能目录中查看我们已验证的技能。
致谢
我们要感谢 Roshni Malani、Meghana Puvvadi、Subodh Prabhu、Mohit Gupta、Yogesh Dangi、Yashraj Basaravaj Patil、Keshav Pradeep、Siddharth Itagi、Alejandro Sanabria Portala 和 Pranita Maske 对本工作的贡献。
