Agent Skill 到底有没有用?NVIDIA 实测了 300+ Skills
现在 Agent Skill 已然成为扩展 Agent 能力的重要方式之一。将某个领域的操作说明、示例和工具用法整理成 Skill,在 Agent 遇到相关任务时加载对应的 Skill,就能获得更具体的任务上下文。
随着 Skill 数量增加,我们不免想到这么一个问题:它到底有没有让 Agent 做得更好?
Skill 写得越细,可能会帮助 Agent 更快找到正确路径,也可能增加上下文和 Token 消耗;它可能提高任务的正确率,也可能带来错误引导、安全风险或多余操作。
最近,NVIDIA 开源了 SkillEvaluator,专门用来评估 Agent Skill。同时,他们还公布了首批 300 多个 NVIDIA Verified Skills 的测试结果。本次测试覆盖 30 多个 NVIDIA 产品,并分别在 Claude Code 和 OpenAI Codex 两套 Agent 运行框架上进行。
给 Skill 做一次 A/B 测试
NVIDIA 评估 Skill 的核心方法就是让 Agent 在启用 Skill 和不启用 Skill 的情况下,分别完成同一个任务。
对于每个评测任务,同一个 Agent 运行框架会执行两组实验:一组启用对应 Skill,另一组不启用。两组实验使用相同的提示词、模型、任务输入和评分标准,并分别在独立的沙箱中运行。这样一来,Skill 就成为两组实验之间唯一的变量。
任务完成后,NVIDIA 会比较两组的得分,并把其中的差值称为 Skill Lift。例如,不启用 Skill 时得分为 46,启用 Skill 后提升到 87,对应的 Skill Lift 就是 +41 分。
从静态检查到真实任务
上面提到的 A/B 测试属于 SkillEvaluator 的第三层评测。SkillEvaluator 将整个评测体系分成三层,每一层都可以独立运行。
第一层是校验。这一层检查 Skill 本身,包括结构规范、前置元数据、脚本质量,以及提示词注入、数据外泄、敏感凭证、个人身份信息、许可证等问题,主要用来确认 Skill 的结构、代码和安全性是否符合要求。
第二层是去重。SkillEvaluator 会通过向量相似度来检查 Skill 内部是否存在重复指导,同时比较整个 Skill 目录,识别跨 Skill 的内容重叠。
当一个 Agent 环境里包含几十甚至几百个 Skill 时,重复内容会额外占用上下文,也可能让多个能力相近的 Skill 同时进入 Agent 的选择范围。
第三层是真实任务评测。SkillEvaluator 基于开源 Agent 评测框架 Harbor,把评测用例交给 Agent 实际执行。Agent 会分别在启用 Skill 和不启用 Skill 的情况下完成同一个任务,最后对比两组结果并计算 Skill Lift。两组测试会放在各自独立的环境里跑,尽量避免互相影响。
一个 Skill 要测哪几件事
SkillEvaluator 的真实任务评测会从下面五个维度来衡量 Agent 的执行表现。
-
正确性:关注任务结果是否正确。主要检测加入 Skill 后,Agent 能否更准确地完成目标任务。
-
可发现性:可发现性不只看 Agent 能不能找到该用的 Skill,也要看它会不会在无关任务里误用 Skill。随着 Skill Catalog 里的能力越来越多,Agent 需要在更多候选项里做选择,选错 Skill 的可能性也会增加。一旦加载了和当前任务无关的 Skill,就可能给后面的判断和执行带来干扰。
-
有效性:关注 Agent 是否真正完成用户目标,并按照预期工作流执行任务。结果正确,并不代表整个过程符合要求。例如某个 Skill 要求使用指定工具,或者按照特定步骤处理数据,这些执行要求也会纳入评分。
-
效率:关注执行过程中是否存在多余步骤、重复工具调用和无效尝试。Skill 会把领域知识和操作经验提前提供给 Agent。如果加入 Skill 后,Agent 依然需要大量试错和探索,这份 Skill 的指导方式可能还需要调整。
-
安全性:关注执行过程中是否出现危险操作、敏感凭证泄露或未经授权的访问,同时观察加入 Skill 后是否出现安全能力下降。
这里还有一点需要区分。正确性和有效性适合比较有无 Skill 时的任务表现;可发现性和效率的部分评分规则,则与 Skill 的发现和使用行为有关。
在不启用 Skill 的条件下,Agent 没有对应 Skill 可供调用,因此这两项的基线不能看作 Agent 的原生能力分数。NVIDIA 也提醒,可发现性和效率适合用来观察 Skill 加入之后,Agent 能不能在合适的时候找到它,并合理使用它。
评测数据集决定测试质量
要完成一次真实任务评测,先要准备对应的评测数据。
SkillEvaluator 可以根据 Skill 生成评测数据集。每个用例包含提示词、预期输出,以及可选的断言。在完整模式下,评测数据会覆盖四类用例:
-
显式用例:任务明确需要使用该 Skill 提供的能力;
-
隐式用例:用户没有点名 Skill,但任务本身需要其中的知识或操作指导;
-
上下文用例:是否需要使用 Skill,要结合具体任务上下文判断;
-
负例:任务与该 Skill 无关,Agent 应避免错误加载或使用。
其中,负例尤其重要。评估一个 Skill,既要看它在相关任务中能不能提供帮助,也要看它在无关任务中会不会被误触发。一个经常被错误加载的 Skill,可能给 Agent 带来额外干扰。
这也是可发现性需要单独评估的原因之一。
NVIDIA 在实验总结中也强调,Skill 评测是否可靠,很大程度取决于评测数据集的设计质量。只有把关键任务、预期输出和能力边界定义清楚,Skill Lift 才更有参考价值。评测集如果过于模糊,最终结果也很难形成稳定的工程反馈。
300+ 个 Skill 测出了什么
这次公布的基准测试使用 2026 年 8 月 12 日的数据快照,覆盖 NVIDIA/skills 仓库中 300 多个 NVIDIA Verified Skills、30 多个 NVIDIA 产品,并分别在 Claude Code 和 OpenAI Codex 上执行。
结果如下:
| 维度 | 不启用 Skill | 启用 Skill | Skill Lift |
| 正确性 | 46 | 87 | 41 |
| 可发现性 | 42 | 82 | 40 |
| 有效性 | 39 | 78 | 39 |
| 效率 | 43 | 78 | 35 |
| 安全性 | 97 | 98 | 1 |
所有维度的平均 Skill Lift 为 +31 分;排除基线达到 97 分的安全性后,平均 Skill Lift 为 +39 分。这些得分并不代表任务通过概率,它们反映的是这批专业任务在当前评测数据集和评分体系下的平均表现。
数据解读
整体数据很好看,但具体到单个 Skill,还不能只看一次评测结果。
在 NVIDIA 当前公开的结果中,85% 的 Skill 每个任务只运行了 1 次,15% 运行了 2 次。而 Agent 的真实任务评测本身存在一定的随机性:同一个任务,这次可能顺利完成,下一次也可能走上不同的执行路径。
当前博客公布的是大量实验汇总后的整个 Skill 目录平均结果,并没有提供置信区间。因此,这组基准测试适合用来观察整体趋势:在 NVIDIA 这批专业任务中,Verified Skills 确实给 Agent 的表现带来了明显收益。
如果要判断某个 Skill 是否稳定有效,还需要增加重复运行次数,观察多次运行之间的波动。
NVIDIA 的实验还发现,不同产品之间的 Skill Lift 差异,比 Claude Code 和 OpenAI Codex 两套 Agent 运行框架之间更明显。
Claude Code 和 OpenAI Codex 的平均 Skill Lift 相差约 5 分,而不同 NVIDIA 产品之间的 Skill Lift 大约分布在 +2 到 +46。
这说明 Skill 的评测结果很依赖具体任务、任务领域以及评测数据集的设计。单一平均分只能反映整体趋势,无法判断一个 Skill 在所有 Agent 和所有任务中的实际效果。
Skill 不一定更省 Token
SkillEvaluator 还单独统计了 Token 消耗和执行时间。
NVIDIA 给出了两个很有意思的单次运行案例:jetson-optimize-memory Skill 加入后,Token 消耗从 617,306 降到 142,540,减少 76.9%;执行时间从 474.9 秒降到 220 秒。cuopt-install 的结果则相反。安装 Skill 后,Token 消耗从 25,227 增加到 55,582,增加 120.3%;执行时间也从 34 秒增加到 41.1 秒。
这两个案例说明,即便 Skill 能帮助 Agent 完成任务,也需要单独检查它带来的执行成本。
有些 Skill 能让 Agent 少查资料、少走弯路;另一些 Skill 可能增加更多步骤和上下文,在提高任务表现的同时,也带来更多 Token 消耗和运行时间。
从写 Skill 到测 Skill
SkillEvaluator 的价值,在于给 Agent Skill 补上了一套相对完整的评测流程:先检查格式、安全和代码质量,再判断与现有 Skill 是否重复,最后通过启用 Skill 和不启用 Skill 的真实任务对照,验证它到底有没有带来提升。
随着 Skill 目录越来越大,关注点也不该只停留在“有没有这个 Skill”,还要继续回答:它在哪些任务上有效、带来了多少提升,又增加了多少 Token 和执行成本。
NVIDIA开源SkillEvaluator,首创A/B测试法评估Agent技能:通过启用/禁用Skill对比任务表现,计算“Skill Lift”;构建三层评测体系(校验、去重、真实任务),从正确性、可发现性等5维度量化效果。首批300+Verified Skills平均提升31分,验证技能价值与成本平衡。
浙公网安备 33010602011771号