NVIDIA 开源 SkillEvaluator:给 Agent Skill 称体重,300 个技能实测平均 +31 分

NVIDIA 开源 SkillEvaluator:给 Agent Skill 称体重,300 个技能实测平均 +31 分

先收藏,你写的 SKILL.md 迟早要用它体检。

Agent Skill 这个生态今年热得发烫:一个装着 SKILL.md 的文件夹,就能给 Claude Code、Codex 这类 Agent 扩展能力,各种技能市场也冒了出来。但有个尴尬的问题一直没人回答——装了技能,Agent 到底变强了没有? 强了多少?会不会某些技能反而帮倒忙?

NVIDIA 上周(8 月 19 日)在开发者博客给出了自己的答案:开源评测框架 SkillEvaluator。他们拿它对 300 多个经过验证的 NVIDIA 技能、跨 30 多个产品做了完整基准测试,结论很有意思:平均提升 31 分,其中正确性从 46 分涨到 87 分;但也有技能让 token 消耗直接翻倍。

技能不是装上就赚,这事得测。这篇文章把 SkillEvaluator 的三层架构、基准数据和上手方法拆开讲一遍。

本文提纲

  1. 为什么要给技能"称体重"
  2. 三层评测管线:从静态体检到真实对练
  3. 基准数据:平均 +31 分,哪个维度涨最多
  4. 反直觉的发现:有的技能让 token 翻倍
  5. 五分钟上手:CLI 怎么用
  6. 生态与落地:谁在用这套东西

为什么要给技能"称体重"

Agent Skill 的本质是往 Agent 的上下文里注入一段产品专属的指令:这个东西是干什么的、什么时候用、怎么调用。注入得准,Agent 少走弯路;注入得烂,Agent 多读一堆无关文字,多花 token,甚至被坏指令带偏。

问题在于,"感觉变快了"不算数。没有对照实验,你永远分不清是技能起了作用,还是模型今天状态好。SkillEvaluator 的核心思路就是对照:同一个任务、同一个模型、同一套评分规则,装技能跑一遍,不装跑一遍,差值就是技能的真实贡献——NVIDIA 管这个叫 Skill Lift(技能提升值),以分计量。

这个思路简单,但把执行做扎实需要沙箱、需要可复现的任务生成、需要隔离环境,这正是它三层管线要解决的事。

三层评测管线:从静态体检到真实对练

MERMAID_BLOCK_0

Tier 1 是静态体检。 校验 schema 和 frontmatter 结构、质量评分、安全检查(prompt 注入、数据泄露风险)、凭据和个人隐私信息探测、许可证审查、脚本 lint。这一层的大部分检查是确定性的,不需要 API key——一个装好的 CLI 就能跑。深度安全扫描会联动 Semgrep、SkillSpector(NVIDIA 自家 1.5 万 stars 的技能安全扫描器)和 Gitleaks。

Tier 2 查重。 用向量相似度做两件事:找出单个技能内部的重复指导(技能越写越长是通病),以及整个技能目录里互相重叠的覆盖。这层需要 embedding 服务,本地 OpenAI 兼容端点也能跑。

Tier 3 才是真刀真枪。 SkillEvaluator 把评测用例转换成 Harbor(开源 Agent 评测框架)任务,让 Agent 在 Docker 隔离沙箱里真实执行生成的任务,带技能和不带技能各跑一遍,再按统一规则打分。生成的用例分四类:显式、隐式、上下文相关和负面用例——负面用例专门测"不该触发技能时会不会乱触发"。

基准数据:平均 +31 分,哪个维度涨最多

基准用的是 2026 年 8 月 12 日 NVIDIA/skills 仓库 benchmarks.json 的快照(宏平均,每个技能-框架组合权重相等),五个维度的满分都是 100:

维度 无技能 有技能 提升
正确性 Correctness 46 87 +41
可发现性 Discoverability 42 82 +40
有效性 Effectiveness 39 78 +39
效率 Efficiency 43 78 +35
安全性 Security 97 98 +1

几个值得咂摸的细节。正确性接近翻倍,说明技能最大的价值是把"Agent 靠猜"变成"Agent 知道标准做法"。安全性基线高达 97、提升只有 1 分,这不是坏事——它说明装技能几乎没有引入安全回归。可发现性和效率的基线不是零,因为不装技能时,Agent 靠合理的工具调用和干净的执行也能拿分。

框架对比也有意思:Claude Code 全维度 +34(剔除安全性 +42),OpenAI Codex +29(剔除安全性 +36)。差距主要来自默认提示词、上下文处理和工具调用行为的不同。但注意量级:框架之间平均只差 5 分左右,而不同产品的技能提升从 +2 到 +46 不等——技能写得好不好、领域特不特殊,远比选哪个框架重要。

反直觉的发现:有的技能让 token 翻倍

token 消耗是单独追踪的,不并入效率分。两组单次运行的对比很有代表性:

jetson-optimize-memory 技能:token 从 617,306 降到 142,540,省了 76.9%;运行时间从 474.9 秒降到 220 秒,省了 53.7%。技能直接告诉 Agent 该用哪些工具、按什么顺序来,Agent 不再反复试错。

cuopt-install 技能:token 从 25,227 涨到 55,582,多了 120%;运行时间也多了 20.8%。注入的指令本身要吃上下文,如果任务不够复杂、技能写得又啰嗦,省下的试错成本覆盖不了注入成本。

这就是"称体重"的意义:技能优化不是自动发生的。 没有评测,你根本不知道手里的技能是前者还是后者。

也得说说局限:目前公布的技能大多只跑了一次(85% 单次、15% 两次),Agent 的真实运行有随机性,官方没有给置信区间;分数代表专业任务上的平均表现,不是通过概率。把它当体检报告看,别当物理常数。

五分钟上手:CLI 怎么用

SkillEvaluator 是 Python 3.12/3.13 的 CLI,Apache 2.0 协议。装完先跑一次零成本的静态体检(不需要任何 API key):

uv tool install --python 3.13 \
  "skillevaluator[all] @ git+https://github.com/NVIDIA/SkillEvaluator.git"

skillevaluator validate ./my-skill \
  --checks schema,pii,license,quality,unicode,lint \
  --no-dedup

./my-skill 是任何包含 SKILL.md 的目录。想进 Tier 3 真实对练,先生成评测数据集,再让 Agent 带着技能上擂台:

skillevaluator create-eval-dataset ./my-skill --full
# 生成 evals/evals.json:用例 ID、提示词、期望输出、断言
# --full 会补齐显式 / 隐式 / 上下文 / 负面四类用例

skillevaluator tier3 evaluate ./my-skill --agents codex --env-mode docker
# Codex 在 Docker 沙箱里带技能 / 不带技能各跑一遍,输出评分对比

模型凭据这块很灵活:NVIDIA Build(免费注册,默认跑开源 Nemotron)、OpenAI、Anthropic、Bedrock、本地 OpenAI 兼容端点都行,一个 key 贯穿三层评测。

生态与落地:谁在用这套东西

SkillEvaluator 不是孤立的工具,它嵌在 NVIDIA 的一整条技能流水线里:NVIDIA/skills 仓库(约 3000 stars,2 月创建)是 Verified Skills 的生产线,SkillSpector(约 1.5 万 stars)管安装前的安全扫描,Harbor(约 4600 stars)提供沙箱执行。官方给 Claude Code、Codex、Cursor 都发了插件,技能还通过 Skills.sh、ClawHub、Hermes Hub 分发。

第三方已经在跟进:OpenClaw 在 ClawHub 上试点,把带技能和不带技能的评测结果直接展示在 Evals 标签页里;Nous Research 在 Hermes Agent 里集成了 SkillSpector 的安装前扫描,检查 PII、Unicode 走私、脚本质量、许可证和安全隐患,单次扫描只要 1.4 秒左右。

技能市场接下来大概率会卷"评测透明度"——就像 App Store 时代的崩溃率报告。你发布技能之前,不妨先跑一遍 skillevaluator validate,至少知道自己交出去的东西过了体检。

参考文档与链接

你装过帮倒忙的技能吗?或者自己写过 SKILL.md?评论区聊聊你的实测感受。觉得有用就点个赞,让更多人看到。


作者: itech001
来源: 公众号:AI人工智能时代(the-ai-era)
网站: https://www.theaiera.top/
关注每日最新AI新闻和技术博客,主页有更多的文章的AI 技术参考:https://www.theaiera.top

本文首发于 AI人工智能时代,转载请注明出处。

posted @ 2026-08-24 22:18  iTech  阅读(6)  评论(0)    收藏  举报