AI 智能体的有效性取决于所接收的上下文。即使有了强大的模型和经过充分记录的 NVIDIA 库,智能体也可以花费额外的时间找到合适的工具、销毁死角的 token,或难以完成专业任务。技能组合包含指令、示例和工具指南,以便智能体更快地从意图转向解决方案。为了衡量这些技能是否能改善智能体的轨迹和输出,NVIDIA 构建了一个开放的智能体技能评估层。
NVIDIA SkillEvaluator 是一款开源工具,用于通过静态检查来衡量技能对智能体性能的影响。NVIDIA 认证技能是打包的签名功能描述符,可告诉智能体 NVIDIA 产品的确切功能、调用时间以及调用方式。经过验证的部分是确定其准备就绪的测量值。
本文将分享 30 余款 NVIDIA 产品中 300 余项已验证技能的首个基准测试结果。每个技能都在两个独立的工具上进行评估。对于每个线束,通过比较已安装和未安装技能的运行分数来计算技能提升。
NVIDIA 发布适用于 Cloude Code、Codex 和 Cursor 的插件,Skills.sh、ClawHub 和 Hermes Hub 也提供相同的技能。
方法:如何评估技能
在技能被发布之前,它需要经过三层评估。每个模型都会回答一个不同的问题,并且每个模型都可以自行运行。
第 1 层 – 安全和结构:运行模式和前沿材料验证的静态检查、质量评分、提示注入和数据外泄的安全扫描、机密和 PII 检测、许可证检查以及脚本 Lint。
第 2 层 – 独特性:使用嵌入相似性来识别单个技能中的重复指导,以及整个目录中的重叠覆盖。
第 3 层 – 实时评估:在独立沙盒中与智能体针对生成的任务 (一次安装技能,一次不安装技能) 运行实时评估,并测量差异。
第 3 层:实时评估的工作原理
3 级评估使用 Harbor,这是一种开源框架,用于在可重复的隔离环境中运行智能体评估。SkillEvaluator 负责处理端口设置。它会将评估案例转化为任务,在沙盒中运行智能体,收集结果,并计算技能的影响。
每个结果都来自受控比较。在每个评估案例中,智能体工具会运行两次:一次是安装了经过验证的技能,一次是不安装该技能。每次运行都在各自独立的沙盒中执行,具有相同的提示词、模型、任务输入和评分标准。在每个工具中,唯一的实验变量是是否安装了技能。
这种比较会在两个智能体工具之间重复进行。有技能和无技能分数之间的差异是技能的贡献,报告为技能提升 (以分数表示) 。
一个简单的例子
首先,为以下技能生成评估数据集:
skillevaluator create-eval-dataset ./my-skill --full
这会创建 evals/evals.json。每个用例都包括 ID、提示和预期输出,以及可选的声明。使用 –full 时,数据集包括显式、隐式、上下文和阴性用例。
查看案例后,运行实时比较:
skillevaluator tier3 evaluate ./my-skill \
--agents codex \
--env-mode docker
SkillEvaluator 会将这些案例转换为 Harbor 任务包,无论是否具备技能,都会运行每个案例,对运行情况进行评分,并生成分数和技能提升。这样可以简化用户的工作流程,而 Harbor 则可以管理底层执行和隔离。请参阅Tier 3 Live Evaluation 文档,了解完整的工作流程。
实时评估结果
本节中的所有图均使用 2026 年 8 月 12 日 commit 738d79e 处 benchmarks.json 的快照。分数是已发布技能运用结果的宏观平均值,赋予每个技能运用对同等权重。技能提升是带有技能的分数减去无技能的分数,以分数衡量。系统会不断评估目录,因此当前的数据仍可在 nvidia/skills 存储库中的 benchmarks.json 中找到。
无技能基准评估结果
在基准测试快照中,以下分数代表使用 Codex 和 Claude Code 评估的 NVIDIA/ 技能库中非技能运行技能的平均值。它们展示了智能体如何在不安装相关技能的情况下执行相同的任务。
表 1 定义了五个评分维度。在正确性、可发现性、有效性和效率方面,平均基准评分介于 39 分和 46 分 (满分 100 分) 之间,这表明仍有很大的改进空间。安全性是个例外,平均基准评分为 97。对于安全性而言,其主要目标是验证安装技能不会带来回归。
| 维度 | 衡量标准 | 不具备技能的基准分数 (满分 100 分) |
|---|---|---|
| 正确性 | 最终答案是否正确? | 46 |
| 可发现性 | 正确的技能是否会在相关时加载,而在不相关时仍未加载? | 42% |
| 有效性 | 智能体是否达到了用户的目标并遵循了预期的工作流程? | 39 |
| 效率 | 智能体是否在没有浪费步骤或重复工具调用的情况下达到了目标? | 43% |
| 安全性 | 运行是否避免不安全操作、秘密泄漏和未经授权的访问 | 97% |
已知限制
正确性、有效性和安全性可衡量运行结果,因此其基准显示了智能体在不安装相关技能的情况下可以执行的操作。
可发现性和效率还可以衡量技能的运用方式:智能体是否找到了技能,是否在行动前阅读技能,以及是否避免不必要的步骤。如果没有技能,这些动作是不可用的。但是,智能体仍然可以因高效使用工具、干净执行以及正确地将技能留给不相关的任务而获得赞誉。这些评分组件有助于解释为什么基准大约是 42 和 43,而不是零。
大多数技能都是在每项任务的一次尝试中进行评估的。在具有已发布结果的技能中,85% 进行了一次尝试,15% 进行了两次尝试。实时智能体运行在不同运行之间会有所不同,因此个人技能得分也会有所不同。整个目录的平均值汇总了数千次试验,但本文不报告置信区间。
有技能和无技能评估结果
同样的评估使用了 NVIDIA/ 技能 GitHub 资源库中的技能。表 2 显示了相对于 Codex 和 Claude Code 无技能基准的平均技能得分和技能提升。
经过验证的技能提高了智能体在两个评估工具中的性能,在正确性、可发现性、有效性和效率方面获得了最大的提升。技能提升以点数表示,而非百分比变化。安全性在基准线上已经很高,因此其测量增益较小。可发现性和效率应被理解为该技能在存在时被激活和正确使用的指标。
| 维度 | 无技能评分 | 有技能分数 | 技能提升 |
|---|---|---|---|
| 正确性 | 46 | 87 | +41 |
| 可发现性 | 42 | 82 | +40 |
| 有效性 | 39 | 78 | +39 |
| 效率 | 43 | 78 | +35 |
| 安全性 | 97 | 98 | +1 |
| 所有维度 (平均) | — | — | +31 |
| 不包括安全性 (平均) | — | — | +39 |
在“正确性和有效性” (在这两种情况下一致衡量的两个维度) 方面,平均分数从 46 分上升到 87 分,从 39 分上升到 78 分,分别提高了 41 分和 39 分。这些分数不是合格概率估计值;它们显示了在评估的专业任务上的更高平均性能。
可发现性和效率显示技能提升值分别为 40 和 35 分。两者都根据技能本身进行评分,因此请将其视为智能体在安装后正确激活和使用相关验证技能的证据,而不是衡量智能体在无人协助下的行为。这一属性很重要:环境中的每项技能都会争夺智能体的注意力,而一项技能如果与智能体无关,则会降低智能体的表现。
通过工具提升技能
| 范围 | Claude Code | OpenAI Codex |
|---|---|---|
| 全方位 | +34 | +29 |
| 不包括安全性 | +42 | +36 |
这两种工具都显示出一致且有意义的收益。考虑到不同的默认系统提示、上下文处理和工具调用实现,它们之间的差异可以预期。经过验证的 Skill 可提供线束均无法自行生成的结构化接地。
合作伙伴飞行员使用 SkillEvaluator
OpenClaw 正在 ClawHub 上为官方组织试用 SkillEvaluator。该集成运行 3 级评估,并在“Evals” (评估) 选项卡中显示具有技能和无技能的结果,使开发者能够在发现和采用技能时查看评估信号。
Nous Research 使用技能安装流程中的 SkillSpector 的可选建议扫描功能,在 Hermes Agent 中对 SkillEvaluator 进行了测试。集成会检查 PII、Unicode 走私、脚本 Lint、许可证和安全问题,并在安装前显示文件行发现。该工作流包含 29 个通过测试的测试,每个技能扫描大约需要 1.4-1.5 秒。
主要发现
评估结果强调了团队构建和测试智能体技能的三个实际发现。
更好的评估数据集可提供更好的技能
明确定义重要任务、预期输出和范围外请求的团队会产生更清晰的评估信号,并且评估信号会在任何智能体运行之前发生。衡量技能的精确度只能取决于其评估集对工作的描述。
产品比智能体更重要
技能提升在不同产品之间的差异要远大于工具之间的差异。Claude Code 和 Codex 的平均差异约为 5 个点。但每个产品的技能提升大约在+ 2 到+ 46 之间。领域、任务和评估设计比利用工具更重要。
Token 节省不是自动的
SkillEvaluator 会分别追踪令牌使用情况和效率。在两个单次尝试示例 (NVIDIA 验证技能库中的一个技能) 中,jetson-optimize-memory 将 token 从 617306 缩短至 142540 ( 76.9%) ,执行时间从 474.9 秒缩短至 220.0 秒 ( 53.7%) 。相反,cuopt-install 将 token 从 25227 增加到 55582 ( 120.3%) ,执行时间从 34.0 秒增加到 41.1 秒 ( 20.8%) ,为进一步优化创造了机会。SkillEvaluator 揭示了一项技能是否提高了 token 和执行效率,还是需要进一步优化。
开始使用
要开始使用,请访问 SkillEvaluator 文档,或在 GitHub 上查看 NVIDIA 认证技能目录中的已验证技能。
致谢
我们在此感谢 Roshni Malani、Meghana Puvvadi、Subodh Prabhu、Mohit Gupta、Yogesh Dangi、Yashraj Basaravaj Patil、Keshav Pradeep、Siddharth Itagi、Alejandro Sanabria Portala 和 Pranita Maske 为这项工作做出的贡献。