微软发布 Agent Lightning v1.0.1:一行命令,让 Claude Code 帮你调 Agent
微软发布 Agent Lightning v1.0.1:一行命令,让 Claude Code 帮你调 Agent
调 Agent 这件事,终于有人给配了个"教练"。
微软昨天(8 月 24 日)给 Agent Lightning 发了 v1.0.1。如果你没听过这个项目,一句话说清它的野心:用强化学习训练任意 AI Agent,而且几乎不用改你的一行代码。仓库 2025 年 6 月在 Microsoft Research 立项,现在 1.7 万 stars,MIT 协议。
这次更新最有意思的不是修 bug,而是官方首次发布了一个配套的 Agent Lightning Skill——装上之后,Claude Code、Codex 或 GitHub Copilot 就能化身"Agent 调优顾问",对着你的 Agent 和基准测试做系统性迭代。优化 Agent 这件事,从"自己瞎调"变成了"有教练带"。
这篇文章把项目的核心思路、v1.0 的重构、最新基准数据,以及 v1.0.1 的 Skill 一次讲透。
本文提纲
- 核心卖点:零代码改动,用 RL 训练任意 Agent
- v1.0 大重构:3500 行代码和三个组件
- 硬核成绩:6K 样本,SWE-bench 涨 14.6 个点
- v1.0.1 的新东西:Agent Lightning Skill
- 怎么上手:有 GPU 和没 GPU 的两条路
- 社区已经在拿它干什么
核心卖点:零代码改动,用 RL 训练任意 Agent
Agent 的强化学习训练一直是块硬骨头。传统做法要把 Agent 拆成框架能理解的标准格式,工具调用、上下文管理、控制流全得重写——等于把房子拆了重盖,就为了换个灯泡。
Agent Lightning 的思路是不碰你的房子。Agent 照常跟模型对话,只是所有请求经过一个代理层(API Gateway)。这个代理层悄悄把交互轨迹录下来,变成训练数据。你的工具、环境、控制流原封不动,"真实 harness"全程在环。
项目 2025 年 8 月发了第一篇论文(Train ANY AI Agents with Reinforcement Learning),当时支持 AutoGen、LangGraph、CrewAI 这些框架。今年 8 月 17 日的 v1.0 则是彻底重构,把"大而全"砍成了"小而准"。
v1.0 大重构:3500 行代码和三个组件
v1.0 的第一原则是简单:整个框架约 3500 行代码,架构只剩三个组件。
MERMAID_BLOCK_0
Trainer 跑 verl 和 vLLM,负责构建样本和更新策略;Rollout Controller 让 Agent 在本地或 Kubernetes Job 里跑;API Gateway 做模型代理,把交互转成训练数据。三者闭环:Trainer 发起 rollout,Controller 拉起 Agent,Gateway 记录轨迹。Kubernetes 是原生支持的,不需要额外的沙箱服务。
官方示例覆盖了从玩具到实战的完整光谱:Calc-X 是单卡就能跑的数学推理 POC(AutoGen + MCP 计算器),GSM8K 和 ScienceWorld 练推理和交互,Search-R1 做多轮检索推理,LLM-in-Sandbox 给 Agent 配电脑和代码执行工具,最硬核的 Coding Agent 直接用代码仓库的测试当奖励信号。
硬核成绩:6K 样本,SWE-bench 涨 14.6 个点
v1.0 的旗舰结果值得单独拎出来:用纯 RL 训练一个端到端 Coding Agent,只用 6000 个训练样本,Qwen3.5-9B 在 SWE-bench Verified 上从 41.8% 提到 56.4%,净涨 14.6 个百分点。
这个数字的分量在于两点。一是样本效率,6K 样本对 RL 来说相当克制;二是他们把完整管线全开源了,包括数据清洗、防 reward hacking 的手段和训练脚本——reward hacking(Agent 学会钻评测空子而不是真解题)是 Agent RL 里最容易翻车的地方,官方把这个坑的处理经验一并交了出来。
配套的技术报告 Agent Lightning v1.0: Towards Harnessed Agentic RL 8 月 19 日挂上 arXiv。标题里的 "Harnessed" 就是那个"真实 harness 在环"的理念:训练的不是温室里的标准接口,而是真实跑在生产形态里的 Agent。
v1.0.1 的新东西:Agent Lightning Skill
说完主线,看这次的新增量。v1.0.1 首次正式发布了 Agent Lightning Skill,定位一句话说清:让 coding agent 帮你优化别的 Agent。
用法是给它一个"可编辑的 Agent"加一份基准测试,Skill 会引导对 prompt、工具、工作流、模型选择、推理参数做系统性改进,同时在准确率、成本、延迟、可靠性之间找平衡——靠的是"测量驱动的迭代",每改一步都用数据说话,而不是凭手感。安装一行命令:
gh skill install microsoft/agent-lightning agent-lightning --agent <agent>
<agent> 支持 Claude Code、Codex、GitHub Copilot。这个版本同时强化了 CI、打包、发布自动化和基准测试报告——看得出微软是把这个仓库当长期产品在运营的。
值得咂摸的是这个组合:RL 训练优化的是模型权重,需要 GPU 和数据;Skill 优化的是 prompt 和工程侧,在 coding agent 里就能跑。两条路互补,没卡的团队也有一条官方认可的优化路径。
怎么上手:有 GPU 和没 GPU 的两条路
没 GPU / 不想训练:直接装 Skill,让 Claude Code 带着基准测试调你手头的 Agent,这是 v1.0.1 之后门槛最低的入口。
想真训一个:安装基于 CUDA 13.0 + verl 0.8.0,官方参考配置:
git clone https://github.com/microsoft/agent-lightning.git
cd agent-lightning
uv sync
bash scripts/setup_verl.sh 0.8.0 cu130
第一次跑建议从 Calc-X 开始,单卡就能验证整条链路,再逐步升级到 Search-R1、Coding Agent 这类多轮、带沙箱的场景。文档结构很完整,从安装、异步训练到 Gateway 配置都有专章。
社区已经在拿它干什么
1.7 万 stars 不是白给的,社区玩法已经挺野了。腾讯优图的 Youtu-Agent 基于它的修改分支,验证了 128 卡规模的数学/代码/搜索 RL 训练,收敛稳定;斯坦福的 AgentFlow 用 Flow-GRPO 算法组合规划-执行-验证多 Agent,专攻长程稀疏奖励任务;还有拿它训练中文狼人杀 Agent 的 DeepWerewolf。大厂、学界、整活党三件套齐了。
从"训练任意 Agent"到"让 coding agent 调任意 Agent",Agent Lightning 一年间把 Agent 优化这件事从论文做成了产品链路。如果你的 Agent 还在靠人肉调 prompt,是时候让机器来卷机器了。
参考文档与链接
- GitHub: microsoft/agent-lightning — 1.7 万 stars,MIT 协议,"The absolute trainer to light up AI agents"
- Agent Lightning v1.0.1 Release — 本文起因:Agent Lightning Skill 首发
- Agent Lightning v1.0 技术报告 (arXiv 2608.17528) — Towards Harnessed Agentic RL,2026-08-19
- Agent Lightning 原始论文 (arXiv 2508.03680) — Train ANY AI Agents with Reinforcement Learning,2025-08
- 官方文档 — 安装、Quick Start、组件、异步训练与全部示例
- Microsoft Research 项目页 — 项目背景与团队
- GitHub: TencentCloudADP/Youtu-agent — 128 GPU RL 训练实践与配方
- vLLM 博客:No More Retokenization Drift — Agent RL 中 token 对齐问题的工程细节
你的 Agent 现在靠什么调优,人肉还是有 pipeline?评论区聊聊。觉得有用就点个赞,让更多人看到。
作者: itech001
来源: 公众号:AI人工智能时代(the-ai-era)
网站: https://www.theaiera.top/
关注每日最新AI新闻和技术博客,主页有更多的文章的AI 技术参考:https://www.theaiera.top
本文首发于 AI人工智能时代,转载请注明出处。

浙公网安备 33010602011771号