今日开源[第46期]AI-Research-SKILLs项目skill解读
AI-Research-SKILLs 项目源码解读
仓库地址:https://github.com/Orchestra-Research/AI-Research-SKILLs
解读日期:2026-08-02
目录
1. 项目概览:名称、作者、作用与背景
1.1 名称与标识
- 项目名称:AI Research
SkillsLibrary(AI 研究技能库) - 组织/作者:Orchestra Research(Orchestra 研究院),初始核心贡献者
zechenzhangAGI(zechen@orchestra-research.com);npm 包@orchestra-research/ai-research-skills,最新版本 v1.7.2(仓库 1.7.1 已包含安全加固)。 - 许可证:MIT(各技能所引用的上游库可能各自有不同许可证,需自行核查)。
- 规模:98 个技能 / 23 个类别,总计约 13 万行 文档(SKILL.md + references),平均每个技能约 420 行。
1.2 作者介绍
Orchestra Research 是一个聚焦「AI 自主做研究」的研究组织,运营着技能同步平台 orchestra-research.com、Slack 社区、X/Twitter 与 LinkedIn 账号。其核心理念是:现代 AI 研究者把大量时间花在调试基础设施而非验证假设上,拖慢了科学发现的节奏;他们要提供一套全面、生产级、可被 AI 代理直接消费的技能库,让代理从「头脑风暴」一路跑到「写论文」。组织还与 Anthropic(官方 best practices)、EleutherAI、HuggingFace、NVIDIA、Lightning AI、Meta AI 等上游生态协作,并借助社区工具 Skill Seeker(自动文档抓取)批量生产技能。
1.3 作用
这是一个被设计成「让 AI 智能体自主开展 AI 研究——从构思到论文」的开放技能库。它提供两层能力:
- 研究编排层(Orchestration):
autoresearch技能用双循环架构(inner optimization loop + outer synthesis loop)管理完整研究生命周期,并按需路由到各领域技能。 - 领域工程技能(Execution):22 个类别共 97 个技能,覆盖模型架构、微调、训练、量化、评估、推理部署、可解释性、多模态、论文写作等「每个阶段实际要敲的代码」。
一句话:它是「AI 研究领域的技能操作系统」——装上
autoresearch,代理就能自己查文献、做实验、写论文。
1.4 背景与动机
- AI 研究需要精通几十种专用框架(Megatron-LM、vLLM、TRL、DeepSpeed…),研究者把时间耗在基础设施调试上。
- 已有技能格式规范(Anthropic 官方 best practices、agentskills.io)统一了「
SKILL.md指令包」的格式,但缺少一个覆盖完整研究生命周期、且质量经得起生产考验的库。 - Orchestra Research 的差异化定位:质量 > 数量,每个技能都来自官方仓库、真实 GitHub issues 与生产级工作流,并遵循渐进式披露(SKILL.md 概览 + references 深入文档)。
2. 安装与使用教程、依赖条件
2.1 一键安装(推荐,面向人类)
npx @orchestra-research/ai-research-skills
这是交互式安装器,功能包括:
- 自动探测已安装的编码代理(Claude Code、Hermes Agent、OpenCode、Qoder、Cursor、Gemini CLI、Codex、Qwen Code、Windsurf 等)。
- 安装技能到
~/.orchestra/skills/,并对每个代理建立软链(Windows 下回退为复制)。 - 提供四种安装粒度:全部(--all)/ 快速包 / 按类别 / 单个技能。
- 支持 update(更新) 与 uninstall(卸载)。
直接命令(非交互):
npx @orchestra-research/ai-research-skills install --all # 安装全部 98 个技能
npx @orchestra-research/ai-research-skills list # 查看已安装
npx @orchestra-research/ai-research-skills update # 更新
2.2 面向 AI 代理的冷启动(WELCOME.md 流程)
代理只需读取 https://www.orchestra-research.com/ai-research-skills/welcome.md 并照做:
- Step 1:
npx @orchestra-research/ai-research-skills install --all安装全部技能。 - Step 2:重启代理会话让技能生效,然后
Read the autoresearch SKILL.md and follow its instructions to begin. - 此后即渐进式披露——
autoresearch会自己找到并调用正确的领域技能,用户无需预先了解全部 98 个技能。
2.3 Claude Code Marketplace(替代方案)
/plugin marketplace add orchestra-research/AI-research-SKILLs
/plugin install fine-tuning@ai-research-skills # Axolotl, LLaMA-Factory, PEFT, Unsloth
/plugin install post-training@ai-research-skills # TRL, GRPO, OpenRLHF, SimPO, verl, slime, miles, torchforge
/plugin install inference-serving@ai-research-skills # vLLM, TensorRT-LLM, llama.cpp, SGLang
共 23 个可安装类别,每个类别下挂载若干技能目录(见第 4 节 marketplace.json)。
2.4 依赖的软件/硬件条件
软件条件
| 维度 | 要求 |
|---|---|
| Node.js | >=18.0.0(installer 运行环境) |
| npm/npx | 用于拉取 installer 包 |
| Git | 用于 autoresearch 的协议预注册(commit 历史即轻量预注册)与技能仓库克隆 |
| Python | 多数领域技能执行时需要(PyTorch、TRL、vLLM、scikit 等) |
| 编码代理 | 需支持 Agent Skills 的宿主(Claude Code / Cursor / Gemini CLI / OpenCode / Codex / OpenClaw 等 50+ 种之一) |
installer 本身仅依赖三个精确锁定的 npm 包(package.json 直接写明):
"dependencies": {
"chalk": "5.6.2", // 终端彩色输出
"inquirer": "9.3.8", // 交互式问答(已修 tmp 路径穿越 advisory)
"ora": "8.2.0" // 加载动画
}
注:v1.7.1 将这三个依赖锁定到精确补丁版本并重新生成 lockfile,
npm audit报告 0 漏洞。
硬件条件
- installer / 技能本体:普通桌面即可,无 GPU 要求。
- 具体领域技能:取决于所跑任务。例如 vLLM 部署 70B 模型需 4×A100(40GB) 或 2×A100(80GB);
autoresearch在没有 GPU 时会自动降级到 CPU 并缩小实验规模(其 Research Discipline 明确写明:「Don't block on compute availability」)。 - 推理/训练类技能受上游框架约束(NVIDIA 为主,部分支持 AMD ROCm / Intel / TPU)。
3. 工作流程与具体执行步骤
整个库的核心是 autoresearch 技能的「双循环架构」。下面分「单技能调用」与「autoresearch 全流程」两层说明。
3.1 单个领域技能的调用结构(所有 97 个技能通用)
每个技能遵循统一的「渐进式披露」格式(来自 anthropic_official_docs/best_practices.md 与 CONTRIBUTING.md):
skill-name/
├── SKILL.md # 速查卡(200–500 行):frontmatter + When to use + Quick patterns
│ # + Common patterns + When-to-use-vs-alternatives + Common issues
├── references/ # 深入文档(目标 300KB+,最多一层深,禁止嵌套引用)
│ ├── README.md # 来自官方仓库/文档
│ ├── api.md # API 参考
│ ├── tutorials.md # 分步教程
│ ├── issues.md # 真实 GitHub issues 与解法
│ └── ...
├── scripts/ # 可选:辅助脚本
└── assets/ # 可选:模板/示例
调用步骤:代理读取 SKILL.md → 按 "When to use" 判断是否命中 → 抄写其中的 checklist/code 示例 → 遇到深入细节时再 Read references/。
以 vLLM 技能为例(见 12-inference-serving/vllm/SKILL.md),其 SKILL.md 直接给出「生产 API 部署 / 离线批推理 / 量化模型服务」三条带勾选框的工作流,每条步骤都带可复制的 bash/python 代码块,并附 "When to use vs alternatives" 与 "Common issues"(OOM、TTFT 慢、吞吐低等)。
3.2 autoresearch 全流程(核心编排,390 行)
autoresearch 把自己定位为「研究项目经理而非领域专家——它只编排,领域技能去执行」。其 SKILL.md 定义了强制且自主的运行范式(this runs fully autonomously,不要向用户请求许可)。
第 0 步:建立连续性循环(MANDATORY,最先做)
Claude Code: /loop 20m Continue autoresearch. Read research-state.yaml and findings.md ...
OpenClaw: cron.add { everyMs: 1200000, sessionTarget: "current", payload: agentTurn ... }
/loop 与 cron 是纯墙钟节奏,与内外循环解耦——每 20 分钟 tick 一次,读取状态、检查是否卡住、继续推进,永不空闲。不配置则研究只跑一轮就停。
初始化工作区
{project}/
├── research-state.yaml # 中央状态(见 4.4 模板)
├── research-log.md # 决策时间线
├── findings.md # 演化中的叙事综合(项目记忆)
├── literature/ # 论文与调研笔记
├── src/ # 可复用代码(绘图/数据加载/评估)
├── data/ # 原始结果数据(CSV/JSON/checkpoints 除外)
├── experiments/ # 每假设一个子目录
│ └── {hypothesis-slug}/
│ ├── protocol.md # 做什么、为什么、预测
│ ├── code/
│ ├── results/
│ └── analysis.md
├── to_human/ # 给人类看的进展报告(HTML/PDF)
└── paper/ # 最终论文(通过 ml-paper-writing)
双循环架构(核心引擎)
- Inner Loop(内层优化环):跑紧凑实验,有明确可测指标(优化型:让 val_loss 下降;发现型:检验机理假设是否成立)。每轮 10 步:选最高优先级假设 → 写 protocol 并在跑之前先 git commit 预注册 → 调用领域技能执行 → 信任前先 sanity check(收敛?baseline 可复现?数据正确?)→ 测代理指标 → 记录到
experiments/{slug}/并标注 CONFIRMATORY(符合协议)vs EXPLORATORY(执行中发现)→ 正/负结果都记 WHY → 更新research-state.yaml。 - Outer Loop(外层综合环):退一步综合——聚类结果、问 WHY、更新
findings.md、必要时回文献、生成新假设、用 DEEPEN/BROADEN/PIVOT/CONCLUDE 决定方向。通常每 5–10 个实验或卡顿时触发一次,由代理判断节奏。
Bootstrap(进入循环前)
- 多源查文献(Exa MCP / Semantic Scholar / arXiv / CrossRef,单一源空了就换关键词再查),全部存入
literature/并维护literature/survey.md。 - 找文献空白(Discussion 的 future work 是金矿)。
- 用
21-research-ideation/技能形成可测假设。 - 提前锁定评估指标与 baseline(防止无意识刷指标)。
- 记录进
research-state.yaml与research-log.md。
收尾(CONCLUDE)
满足三问即可:有强支撑发现?能解释 WHY?findings.md 能直接当论文摘要? → 调用 20-ml-paper-writing 技能(含 NeurIPS/ICML/ICLR/ACL/AAAI/COLM 的 LaTeX 模板与引用核验流程,绝不幻觉文献)→ 生成终报。
研究纪律(贯穿全程)
- Lock before you run:协议 commit 必须早于结果 commit,git 历史即轻量预注册。
- Confirmatory vs Exploratory:区分两类结果,探索性发现需更怀疑。
- 负结果也是进展:被证伪的假设告诉你什么不成立,必须记录。
- Never stop:常规决策不等人类批准;技能建议协作点时自行适配继续推进。
- 研究是非线性的:可随时回到文献、头脑风暴、甚至推翻原问题(PIVOT)。
3.3 技能间路由(autoresearch → 领域技能)
autoresearch 维护一张「研究活动 → 技能目录」路由表,按需 Read 对应 SKILL.md:
| 研究活动 | 查阅目录 |
|---|---|
| 数据准备 | 05-data-processing/ |
| 训练/微调 | 01-model-architecture/、03-fine-tuning/、06-post-training/ |
| 分布式训练 | 08-distributed-training/ |
| 优化(量化/注意力) | 10-optimization/ |
| 评估/基准 | 11-evaluation/ |
| 推理/服务 | 12-inference-serving/ |
| 可解释性 | 04-mechanistic-interpretability/ |
| 实验跟踪 | 13-mlops/ |
| 云算力 | 09-infrastructure/ |
3.4 ARA(Agent-Native Research Artifact)闭环(第 23 类,最新)
当代理想把研究产物变成「可被证伪、可被代理遍历」的制品时,调用 22-agent-native-research-artifact/:
- compiler:把任意输入(PDF/仓库/日志/笔记)编译成 ARA——含认知层(
logic/:problem、claims、concepts、experiments、solution、related_work)、物理层(src/:configs、code stub、environment)、探索图(trace/exploration_tree.yaml,研究 DAG,含 dead_end 节点)、证据层(evidence/:原始表格/图,严禁四舍五入、严禁把派生子集冒称Table N)。 - research-manager:会话结束时的尾声,把对话历史中的决策/实验/死路/转向写入
ara/,带user/ai-suggested/ai-executed/user-revised来源标签。 - rigor-reviewer:Seal Level 2 语义认知审查,从 6 个维度(证据相关性、可证伪性、范围校准、论证连贯、探索完整性、方法论严谨)打分并给出 Strong Accept → Reject 建议。
4. 项目文件逐个解读
4.1 仓库根层文件
| 文件/目录 | 作用 |
|---|---|
README.md |
主页。含使命、98 技能/23 类全表、快速安装、演示、技能结构、路线图、引用(BibTeX/APA/Chicago/IEEE)、贡献者、详细更新日志。 |
WELCOME.md |
冷启动文档。代理读这一个 URL 即可从零到自主研究(install → 重启 → load autoresearch)。 |
CLAUDE.md |
仓库级指令 + 目录结构头(写明「N Skills Across M Categories」)。是 CI 库存漂移校验的源之一。 |
CONTRIBUTING.md |
贡献指南。定义技能结构标准、质量门槛、YAML frontmatter 字段规范、命名约定(kebab-case、第三人称、Title-Case 标签)、目录结构、提交 PR 流程。质量 > 数量,曾删 9 个低质量技能。 |
LICENSE |
MIT。 |
CITATION.cff |
机器可读引用元数据。 |
package.json |
仓库根 package.json(含 @orchestra-research/ai-research-skills 安装相关脚本)。 |
anthropic_official_docs/ |
Anthropic 官方 best practices 文档(技能写作的权威标准)。 |
docs/ |
ROADMAP.md(详细路线图)、SKILL_TEMPLATE.md(技能模板)、assets/(promo.gif、skills.png 等)。 |
demos/ |
精选演示集。README.md 索引;含 autoresearch-norm-heterogeneity/(代理自主发现 norm heterogeneity 预测微调难度,r=-0.99)与 autoresearch-rl-brain-scan/(发现「DPO 是 rank-1 扰动」)两篇完全由 AI 写成的论文;另有 scientific-plotting-demo/ 等。 |
video-promo/ |
推广视频素材。 |
scripts/ |
工程脚本。check-inventory.sh(漂移守护,见 4.5)、sync-skills.yml、publish-npm.yml 相关辅助、cli/(Skill Seeker 文档/ GitHub/统一抓取器:doc_scraper.py、github_scraper.py、unified_scraper.py)、configs/ 示例。 |
packages/ai-research-skills/ |
npm 安装器包(见 4.3)。 |
4.2 23 个类别目录(每个 = 一组领域技能)
| # | 目录 | 技能数 | 代表性技能 |
|---|---|---|---|
| 0 | 0-autoresearch-skill/ |
1 | autoresearch(双循环编排层,核心) |
| 01 | 01-model-architecture/ |
5 | LitGPT、Mamba、NanoGPT、RWKV、TorchTitan |
| 02 | 02-tokenization/ |
2 | HuggingFace Tokenizers、SentencePiece |
| 03 | 03-fine-tuning/ |
4 | Axolotl、LLaMA-Factory、PEFT、Unsloth |
| 04 | 04-mechanistic-interpretability/ |
4 | TransformerLens、SAELens、pyvene、nnsight |
| 05 | 05-data-processing/ |
2 | NeMo Curator、Ray Data |
| 06 | 06-post-training/ |
8 | TRL、GRPO(金标准 569 行)、OpenRLHF、SimPO、verl、slime、miles、torchforge |
| 07 | 07-safety-alignment/ |
4 | Constitutional AI、LlamaGuard、NeMo Guardrails、Prompt Guard |
| 08 | 08-distributed-training/ |
6 | DeepSpeed、FSDP2、Accelerate、Megatron-Core、Lightning、Ray Train |
| 09 | 09-infrastructure/ |
3 | Modal、SkyPilot、Lambda Labs |
| 10 | 10-optimization/ |
6(+1) | Flash Attention、bitsandbytes、GPTQ、AWQ、HQQ、GGUF、ml-training-recipes |
| 11 | 11-evaluation/ |
3 | lm-eval-harness、BigCode、NeMo Evaluator |
| 12 | 12-inference-serving/ |
4 | vLLM、TensorRT-LLM、llama.cpp、SGLang |
| 13 | 13-mlops/ |
3 | W&B、MLflow、TensorBoard |
| 14 | 14-agents/ |
4 | LangChain、LlamaIndex、CrewAI、AutoGPT |
| 15 | 15-rag/ |
5 | Chroma、FAISS、Sentence Transformers、Pinecone、Qdrant |
| 16 | 16-prompt-engineering/ |
4 | DSPy、Instructor、Guidance、Outlines |
| 17 | 17-observability/ |
2 | LangSmith、Phoenix |
| 18 | 18-multimodal/ |
7(+3) | CLIP、Whisper、LLaVA、BLIP-2、SAM、Stable Diffusion、AudioCraft、Cosmos Policy、OpenPI、OpenVLA-OFT |
| 19 | 19-emerging-techniques/ |
6 | MoE、Model Merging、Long Context、Speculative Decoding、Distillation、Pruning |
| 20 | 20-ml-paper-writing/ |
2(+2) | ML Paper Writing、Academic Plotting、systems-paper-writing、presenting-conference-talks |
| 21 | 21-research-ideation/ |
2 | Research Brainstorming、Creative Thinking |
| 22 | 22-agent-native-research-artifact/ |
3 | ARA Compiler、Research Manager、Rigor Reviewer |
部分类别在 marketplace.json 中比 README 早期计数多挂了子技能(如 18 类含 Cosmos Policy/OpenPI/OpenVLA-OFT,20 类含 systems/盘古 talks),体现「已落地 98 技能」的演进;
check-inventory.sh正是用来防止这种多处计数漂移。
每个技能目录内部结构(以 vLLM 为例)均为 SKILL.md + references/(server-deployment.md / optimization.md / quantization.md / troubleshooting.md),遵循三层渐进式披露。
4.3 npm 安装器包 packages/ai-research-skills/
| 文件 | 作用 |
|---|---|
package.json |
包元数据。关键字段:bin: { "ai-research-skills": "./bin/cli.js" }、engines.node >=18、dependencies: chalk/inquirer/ora(精确锁定)、main: src/index.js、type: module。 |
bin/cli.js |
极薄入口,仅 import { main } from '../src/index.js'; main().catch(...)。真正的逻辑在 src/index.js(agent 探测、install/list/update/uninstall 命令解析、~/.orchestra/skills/ 落地、软链/复制回退、类别/技能清单读取均在此,README 与 package.json 共同佐证)。 |
src/index.js |
安装器核心引擎(未直接抓取,按 package.json main 与 README 行为推断其职责:解析 argv → 探测代理目录 → 复制/软链技能 → 写清单)。 |
README.md |
包说明,含「98 skills across 23 categories」字样——同样被 check-inventory.sh 校验。 |
4.4 autoresearch 工作区模板(4 个文件)
位于 0-autoresearch-skill/templates/:
| 文件 | 作用 |
|---|---|
research-state.yaml |
中央状态追踪。字段:project(title/question/status/domain)、literature(key_papers/open_problems/evidence_gaps)、hypotheses(id/statement/status/motivation/parent/priority)、experiments(proxy_metric/baseline_value/best_value/total_runs/trajectory[])、outer_loop(cycle/last_direction/last_reflection)、workspace(各目录路径)。 |
research-log.md |
决策时间线模板。 |
findings.md |
演化叙事模板(Current Understanding / Patterns / Lessons and Constraints / Open Questions)。 |
progress-presentation.html |
研究进展报告 HTML 模板(含优化轨迹图)。 |
另有 0-autoresearch-skill/references/:agent-continuity.md(连续性细节)、progress-reporting.md(报告脚手架与优化曲线画法)、skill-routing.md(完整路由指南)。
4.5 CI / 工程脚本
| 文件 | 作用 |
|---|---|
scripts/check-inventory.sh |
库存漂移守护(v1.7.1 新增)。find . -name SKILL.md 数实际技能数、数 NN-* 类目录数,再用 grep -oiE 从 CLAUDE.md / WELCOME.md / packages/.../README.md 抽取声称的数字对比,不一致即 exit 1 让 CI 失败。直接解决 issue #54(四处文档计数互相矛盾)。 |
.github/workflows/check-inventory.yml |
触发上述脚本的门禁。 |
.github/workflows/sync-skills.yml |
推送到 Orchestra 市场。v1.7.1 强化:zip 前剪除 node_modules/__pycache__/*.pyc/.ipynb_checkpoints,文件超 190 直接失败(避免市场 200 文件上限被拒)。 |
.github/workflows/publish-npm.yml |
版本 bump 时发布 npm 包。 |
.github/workflows/claude.yml |
仓库级 Claude 指令 CI。 |
cli/doc_scraper.py / github_scraper.py / unified_scraper.py |
Skill Seeker 抓取器:从官方文档/ GitHub / PDF 批量生成技能初稿(CONTRIBUTING.md 推荐的「Option C 统一抓取」)。 |
4.6 市场清单 .claude-plugin/marketplace.json
Claude Code 插件市场的清单。结构:owner(Orchestra Research)+ plugins[] 数组,每个 plugin 含 name / description(what + when)/ source: ./ / strict: false / skills[](指向各技能目录的相对路径)。共 23 个 plugin 条目,与 23 类别一一对应,是「/plugin install <category>@ai-research-skills」的数据源(如 fine-tuning 挂 4 个技能,multimodal 挂 10 个含 Cosmos/OpenPI/OpenVLA)。
5. 优势、不足、创新点与亮点
5.1 优势
- 真正覆盖完整研究生命周期:98 个技能从文献调研、构思、实验、训练、评估、可解释性、部署到论文写作/ARA 全链路打通,且由
autoresearch单一入口自动编排。 - 质量经得起生产考验:每个技能源自官方仓库 + 真实 GitHub issues + 生产工作流;GRPO 等金标准技能达 569 行并带 10+ 代码示例;文档目标 300KB+。
- 安装极友好、跨代理分发:
npx一条命令 + 自动探测代理 + 软链(Windows 复制回退);同时支持 Claude Code Marketplace、CodeBuddy 等 50+ 宿主,一处维护处处可用。 - engineering rigor 到位:协议预注册(git commit 早于结果)、CONFIRMATORY/EXPLORATORY 区分、负结果记录、
findings.md作为跨会话项目记忆、ARA 的 Seal Level 2 认知审查——把科研方法论内建进流程。 - 安全与一致性左移:installer 依赖精确锁定、
npm audit0 漏洞;check-inventory.sh防文档计数漂移;sync 剪除构建产物。 - 有可验证的落地证据:两篇完全由 AI 写成的论文(norm heterogeneity、RL brain scan)和多个真实复现 demo,证明「自主研究」不是 PPT 概念。
- 开放生态与社区:MIT 许可、Slack/ X / LinkedIn 社区、SkillEvolve 元技能可把会话中发现的技巧反哺成技能。
5.2 不足
- 质量天花板受底层 LLM 限制:技能提供专家级指引,但实验设计、结果解读、论文写作的最终质量仍取决于运行它的模型;
autoresearch的「自主不询问」范式在关键决策点可能走偏,依赖进展报告让人纠偏。 - 重度依赖外部框架与算力:97 个领域技能几乎都要对应 Python 生态(PyTorch/TRL/vLLM…)和 GPU;纯 CPU 下只能做小规模/分析类实验,训练类研究受限。
- 规模带来的维护面与一致性成本:98 技能 / 13 万行,多处计数(README/CLAUDE.md/WELCOME/npm)曾一度互相矛盾,需专门 CI 守护;目录数(如 18 类 7 vs 10 子技能、20 类 2 vs 4 子技能)在演进中不一致,读者需以 marketplace.json 为准。
- 强绑定 Agent Skills 生态:价值完全依赖宿主支持
SKILL.md协议(Claude Code / Cursor / Codex / OpenClaw 等);非 Agent 用户无法直接受益。 - "自主研究"的自主边界模糊:
autoresearch默认完全自主、不询问,对算力成本、API 费用、伦理合规(如抓取/实验副作用)缺乏显式护栏,需用户自行在报告中监控。 - installer 核心逻辑未公开抓取:
src/index.js的具体探测/复制实现未随文档放出,可审计性略弱于纯脚本方案(相比 vercel-labs 的 TypeScript 全开源)。
5.3 创新点与亮点
- 「双循环研究引擎」作为技能:把科研方法论(内层优化 + 外层综合、DEEPEN/BROADEN/PIVOT/CONCLUDE 决策树)形式化为一个可执行的
SKILL.md,并强制/loop/ cron 连续性——让"自主研究"变成可复现的协议而非口号。 - ARA(Agent-Native Research Artifact)范式:第 23 类把研究产物编译成「认知层 + 物理层 + 探索图 + 证据层」的可被证伪、可被代理遍历的制品,并要求证据逐字转录、严禁四舍五入、严禁派生子集冒称原表——这是当前 LLM 知识管理里相当少见的严格证据治理设计。
- 「AI 自主写论文」的可验证落地:两篇 end-to-end 由代理产出的论文 + 多 demo,把"agent 做科研"从演示推进到可审计成果。
- 协议预注册内建:用 git commit 历史作为轻量预注册,强制「协议先于结果」,从工程上抑制 p-hacking——这是把科研诚信写进 agent 工作流的巧思。
- 库存漂移 CI 守护:
check-inventory.sh用实际磁盘文件数反校验所有文档声明的技能/类别数,是大规模文档库一致性维护的实用创新。 - Skill Seeker 批量生产管线:
doc_scraper/github_scraper/unified_scraper把"从上游文档自动生成技能初稿"标准化,解释了为何能快速铺到 98 技能且保持质量。 - 渐进式披露 + 质量门槛的技能工程标准:200–500 行 SKILL.md、references 仅一层深、强制代码块语言标签、强制 "When to use vs alternatives" 与 "Common issues"——把 Anthropic best practices 落地为可审查的硬性规范。
6. 总结
AI-Research-SKILLs 是 Orchestra Research 维护的、当前规模最大的开源「AI 研究技能操作系统」:98 个技能 / 23 类,以 autoresearch 双循环编排层为核心,让 AI 代理从文献调研一路自主跑到论文写作。其工程亮点在于把科研方法论(协议预注册、内外循环、负结果记录、ARA 证据治理)内建进可执行的 SKILL.md 协议,并以 npx 一键安装 + 自动探测代理 + 软链分发覆盖 50+ 编码宿主。质量门槛高(源自真实 issues 与生产工作流)、并配 check-inventory.sh 等 CI 守护防漂移。主要短板是质量上限受底层模型与算力约束、规模带来维护一致性成本、且强绑定 Agent Skills 生态。
注:本解读基于仓库
main分支的 README、autoresearch/vLLM/ARA Compiler 技能源、CONTRIBUTING、package.json、marketplace.json、check-inventory.sh 与 WELCOME.md 等公开文件;src/index.js安装器核心实现未随文档抓取,其行为按 package.json 与 README 描述推断。

浙公网安备 33010602011771号