Microsoft Research 发布 Agent Lightning v1.0 轻量级 Agentic RL 框架
Agent Lightning v1.0: A 3,500-Line Lightweight Agentic RL Framework for Training Agents with Real Harnesses
Microsoft Research Asia 发布并开源 Agent Lightning v1.0,一个约 3,500 行代码的轻量级 Agentic RL 框架,用于在真实 agent harness 中训练智能体。
原文展示了用真实 agent harness 参与 RL 训练的设计,可作为编码智能体训练流程的工程参考。

一览
- Harnessed Agentic RL:Microsoft Research Asia 介绍了一种训练范式,其中部署时使用的同一 agent harness 直接参与强化学习,无需在训练框架内重新实现该智能体。
- 轻量化设计:Agent Lightning v1.0 用大约 3,500 行代码提供了完整的智能体 RL 控制平面。
- 原生 Kubernetes 支持:智能体以标准 Kubernetes 作业运行在自管理集群、云 Kubernetes 或本地基础设施上,不依赖付费商业沙盒服务。
- 数据高效的训练方案:一个端到端编码智能体流水线,基于开源数据集、仅使用约 6,000 个训练样本,就将 Qwen3.5-9B 在 SWE-bench Verified 上的 Pass@1 从 41.8% 提升到 56.4%,提高了 14.6 个百分点。
AI 智能体已从单一模型演进为由模型、工具和执行环境构成的复杂全栈系统。它们的能力越来越依赖于从模型外部协调它们的 agent harness。强化学习(RL)是一种让 AI 系统通过试错进行学习的方法,并由针对其行动的奖励和惩罚来引导。RL 可以让这些智能体变得更好,但大多数智能体 RL 系统要求开发者在训练框架内重新实现该智能体。这成本很高,而且意味着被训练的智能体并不完全是最终部署的那个智能体。
为了解决这一问题,Microsoft Research Asia 的研究人员提出了 Harnessed Agentic RL 训练范式,并开源了完全重构的 Agent Lightning v1.0(在新标签页中打开)。与原版相比,Agent Lightning v1.0 更强调保持轻量化、与真实 harness 集成,以及完整、可复现的智能体 RL 训练流水线。
Agent Lightning v1.0 围绕 Harnessed Agentic RL 进行了重构,并带来了关键改进:
- 轻量化:整个框架约 3,500 行代码。Agent Lightning v1.0 以一个小巧清晰、易于理解、修改和扩展的代码库,实现了完整的 Harnessed Agentic RL 系统。
- 在真实 agent harness 上训练:智能体通过 Agent Lightning v1.0 中的大语言模型(LLM)代理访问模型,同时保持现有 harness 代码不变。
- 原生 Kubernetes 支持:智能体直接作为 Kubernetes 作业运行,无需外部商业沙盒服务。自管理集群和本地基础设施都可以支持大规模 rollout。
- 完整的编码智能体训练示例:一个基于 Qwen3.5-9B 构建的端到端流水线,将 SWE-bench Verified 上的 Pass@1 从 41.8% 提升到 56.4%,绝对提升 14.6 个百分点,仅使用约 6,000 个训练样本。
传统 agentic RL 的局限
传统 agentic RL 假设训练框架拥有与环境的交互循环。在 ReAct 风格的循环中,模型生成一个动作,环境返回一个观察结果,该观察结果被追加到上下文中,然后模型生成下一个动作,因此整个 rollout 映射为一条连续的 token 轨迹。早期的 RL 系统,如 verl、AReaL 和 slime,都是以这种方式构建的,这意味着训练一个智能体需要在 RL 框架内部重建它的循环。
真实的执行框架已经超出了这一假设。mini-SWE-agent、OpenHands、OpenCode、Claude Code 和 Codex 等编码代理各自带有自己的上下文管理、工具协议、执行逻辑和依赖,通用型代理系统也是如此。为训练重建一个代理成本高昂,而且重建后的代理可能不再以与部署中的代理相同的方式运行。
Agent Lightning 采取了另一条路径。它在代理和模型之间放置了一个 LLM 代理。代理继续像以前一样运行:只需将先前调用模型 API 的端点指向 Agent Lightning,训练框架就可以观察并记录其模型调用。在 v1.0 中,研究人员更进一步,将这一范式正式定义为 Harnessed Agentic RL:无论部署中使用的是哪种代理执行框架,该执行框架都会在训练期间直接参与强化学习(图 1)。

使用真实执行框架进行训练的四项挑战
Harnessed Agentic RL 与传统 agentic RL 的一个核心区别在于,环境交互循环由代理执行框架而非训练框架处理。训练系统只能观察到一系列 LLM 请求和响应对,因此一次 rollout 可能会被拆分为数量不定的训练样本。这带来了四项关键挑战:
- 重新分词与样本合并:执行框架以文本形式保留上下文,但 RL 训练需要 rollout 期间采样得到的 token ID。再次让文本通过聊天模板和分词器可能会改变 token 边界,因此相邻调用并不总是能够合并为一个样本。
- 优势计算:重新分词、子代理和上下文摘要可能会把一次 rollout 拆分为多个样本。直接在样本级别计算基线和优势,会导致产生更多样本的 rollout 被重复计数,从而改变 rollout 级别原有的统计关系。
- 损失归一化:按样本数对损失求平均,会让产生更多样本的 rollout 获得更高权重。由于样本数通常只是执行框架行为的产物,损失归一化也必须避免受到它的扭曲。
- 训练后端调度:样本数量和长度只有在执行框架完成后才知道,而 GPU 数量以及数据/张量并行配置通常是固定的。后端必须将可变工作负载映射到固定资源上。
用 3,500 行代码构建完整的代理 RL 控制平面
在系统设计上,Agent Lightning v1.0 将简洁性作为首要原则。整个框架约有 3,500 行代码,包含三个核心组件:API Gateway、Rollout Controller 和 Customized Trainer(图 2)。
API 网关存储 rollout、模型和事件,并充当兼容 OpenAI 的 LLM 代理。它将 harness 发起的每一次模型调用与其 rollout 关联起来,并记录训练所需的提示词、响应和对数概率。rollout 控制器启动并管理智能体执行,可以作为本地进程运行,也可以作为标准 Kubernetes 作业运行,从而将智能体执行与训练器分离。基于 verl 构建的定制训练器会创建 rollout,等待其完成,收集样本,并通过样本适配器组装最终的训练样本。因此,对于现有的智能体 harness,通常只需将模型端点指向 Agent Lightning 代理,就足以快速接入 RL 训练。

共置异步 RL
不同智能体的 rollout 时间差异很大。同步 RL 会等待一个批次中最慢的智能体,导致 GPU 闲置;而完全异步 RL 虽然能提高利用率,但需要为 rollout 和训练准备独立的 GPU 池。为此,Agent Lightning v1.0 引入了共置异步 RL,让 rollout 和模型更新共享同一组 GPU。
一旦系统收集到足够的 rollout,更新就会开始:API Gateway 暂停接受新请求,并等待已在进行中的请求完成;更新完成后,rollout 会恢复。整个状态转换对外部智能体 harness 是透明的。在实验中,与同步 RL 相比,这种方法实现了约 2x 的端到端加速,同时使用的 GPU 少于传统异步 RL(图 3)。

在 Kubernetes 上运行智能体
收集足够的 rollout 意味着需要同时运行许多智能体,这会消耗大量 CPU、内存和计算资源。其他 Harnessed Agentic RL 框架通常将这些智能体托管在 Modal Sandbox 或 E2B 等商业沙盒服务上,随着规模扩大,成本会迅速上升。相比之下,Agent Lightning v1.0 将它们作为标准 Kubernetes 作业运行,复用现有的自管理集群、云端 Kubernetes 或本地基础设施(图 4)。现有计算资源得到更高效利用,大规模 rollout 的成本更低,整个流水线也保持开源且可复现。

6,000 个训练样本,性能提升 14.6 个百分点
为了测试这种方法,研究人员基于 SWE-smith、mini-SWE-agent 和 Qwen3.5-9B 构建了一条完整流水线,涵盖数据清洗、环境构建、防止 reward-hacking 的保障措施以及 RL 训练。训练集包含约 6,000 个样本,不需要大规模计算。仅通过 RL 训练,就将 Qwen3.5-9B 在 SWE-bench Verified 上的表现从 41.8% 提升到 56.4%,提升了 14.6 个百分点。
编码智能体实验进一步证实了此前对两个挑战的分析:优势计算和损失归一化。与样本级处理相比,rollout 级优势结合 rollout 级归一化能够获得更高的验证奖励,并在训练期间使策略熵保持更稳定(图 5)。

在新标签页中打开
文章 Agent Lightning v1.0:一个 3,500 行的轻量级智能体强化学习框架,用于通过真实测试框架训练智能体 首先发布于 Microsoft Research。
来源:Microsoft Research · microsoft.com