随着 NVIDIA Isaac GR00T、PI0.5 等大规模视觉—语言—动作(VLA)模型不断发展,机器人策略开始具备更强的多模态理解与跨任务泛化能力。但要将这些能力转化为稳定的任务表现,开发者仍需要持续完成数据采集、模型微调、策略评测和强化学习后训练。如何将这些环节组织为可持续迭代的闭环,成为大规模 VLA 落地的关键挑战。
verl-vla 是一个构建在 verl 之上的开源 VLA 后训练框架,面向这一需求,将真实机器人、仿真环境、遥操作设备和计算资源组织为统一闭环。本文将介绍其统一架构,以及它如何通过分布式训练集群、基于 Web 的数据采集和可组合 workflow,打通数据采集、微调、评测与强化学习,并以可复现 recipe 加速 VLA 落地。
在这一演进中,NVIDIA 与 verl-vla 社区围绕“策略模型—仿真环境—强化学习 recipe”开展协作:将 Isaac GR00T 接入统一训练与评测接口,将 Isaac Lab Arena 纳入可跨节点调度的环境层,并将 RECAP和DSRL 等强化学习方法落地为可复现的在线后训练路径。这些开源贡献让开发者能够在同一框架内完成从 GPU 并行仿真、数据采集到 VLA 适配和策略优化的闭环。
从本地流程到端云协同:VLA 后训练为何需要新基础设施?
机器人学习长期围绕本地流程展开:开发者在机械臂旁采集示范,在本地工作站训练策略,再将模型部署回机器人。对于 ACT、Diffusion Policy 等规模可控的策略,机器人、数据、模型与 GPU 通常位于同一环境,数据采集、模仿学习、部署和人类干预能够快速迭代。
但当模型演进至大规模 VLA,这种本地闭环开始面临新的约束。模型推理与微调通常依赖云端 GPU 或多节点集群,高保真仿真环境也可能运行在独立服务器上,真实机器人和遥操作设备则留在端侧。同时,后训练还需适配不同环境、输入设备和训练范式,包括监督微调、纠错数据再训练以及离线、在线强化学习。若每次切换其中一项都重新搭建流程,工程成本很快会超过算法本身。
因此,面向大规模 VLA 的后训练,需要的不是若干彼此割裂的工具,而是一套统一的端云系统,在同一闭环中完成数据采集、策略优化与评测。下图展示了 verl-vla 围绕这一目标构建的统一架构。

图 1. verl-vla 的端云协同 VLA 后训练统一架构
Workflow 编排数据采集、微调和强化学习流程,TrainCluster 统一调度训练、rollout、环境交互与资源;模型、仿真器、真实机器人和遥操作设备可按需接入同一后训练闭环。
跨越端云与异构资源的统一训练集群:TrainCluster
正如前文所述,端云场景下,资源分散是 VLA 后训练首先面对的问题。模型、环境、训练任务和人类输入不再共享单一运行环境,资源的部署、调度与协同也随之成为每个流程必须处理的复杂性。要解决这一问题,首先需要将分散的资源聚合为一个统一系统。TrainCluster 正是 verl-vla 为此构建的执行底座。
如图 1 所示,TrainCluster 将训练、rollout、环境交互、评测、数据记录和 checkpoint 管理收敛为统一接口。上层 workflow 只需描述当前阶段的操作,无需直接处理 Ray、资源池或模拟器进程;TrainCluster 则根据集群配置启动所需 worker、调度资源并管理其生命周期。资源按角色而非位置组织:环境 worker 可以运行在端侧或仿真节点,rollout worker 可以与训练同机或部署在独立 GPU 上,actor worker 则可扩展至多卡、多节点集群。数据采集、评测和在线强化学习只需组合各自所需的角色。
start()、record()、rollout()、train()、eval() 和 shutdown() 等 API 将这些能力以一致方式暴露;在训推分离部署中,TrainCluster 还负责训练模型与 rollout 模型之间的权重同步。开发者可以先在单机验证流程,再按需将环境、rollout 和训练扩展至不同节点,而无需为新的部署方式重新实现后训练逻辑。
面向端云分布式场景的 Web 数据采集与人类干预
TrainCluster 将分散的计算与环境资源组织为统一系统,但人类参与的数据采集仍面临设备与环境分离的问题:操作者的键盘、游戏手柄或 XR 控制器等遥操设备连接在本地,而环境可能运行在云端仿真器或端侧机器人上。传统遥操作将输入设备直接绑定到环境进程,难以适应这种跨设备、跨网络的场景。
为此,verl-vla 在环境侧启动 Web 服务,操作者可从任意设备打开遥操作界面,并接入自己的本地输入设备。无论环境运行在云端的 LIBERO、Isaac Lab Arena,还是连接到端侧机器人,操作者都能通过一致界面观测状态、发送控制指令并记录轨迹。遥操作适配策略负责将设备信号映射为具体环境动作,因此接入新环境时只需补充适配逻辑,无需重建设备连接、Web 可视化或数据采集链路。图 2 展示了这一统一 Web 界面在不同环境中的遥操作体验。
![]() | ![]() | ![]() |
图 2. 基于 Web 的统一遥操作界面。同一套浏览器交互界面可复用于 LIBERO、Isaac Lab Arena 和端侧机器人环境,操作者可从任意设备接入本地输入设备,完成状态观测、遥操作与轨迹记录。
端云场景下的 DAgger 也需要新的交互方式。本地小模型能够高频推理,可逐步用遥操作动作替换模型动作;而大规模 VLA 的推理和端云通信存在延迟,实际部署通常以 action chunk 保持端侧执行平滑。verl-vla 因而采用轨迹级控制权切换:如图 3 所示,操作者可随时中断自主执行,插入任意长度的恢复或纠正轨迹,再将控制权交还给策略。完整轨迹及其控制状态会被统一记录,并进入后续微调与强化学习 workflow。

图 3. 端云场景下的轨迹级人类干预。 云端策略生成并下发 action chunk,端侧自主执行;操作者可在任意时刻中断执行,插入任意长度的恢复或纠正轨迹,再将控制权交还给策略。
以 Workflow 统一编排完整后训练流程
TrainCluster 统一端云资源,Web 环境循环统一数据采集与人类干预;而 Workflow 则将这些能力编排为完整的后训练流程。它定义各阶段的执行顺序与数据流转,TrainCluster 负责资源调度和 worker 生命周期,Trainer 专注于算法更新,从而将流程编排、分布式执行与算法实现解耦。
RECAP recipe 展示了这一机制:它复用已有的评测、轨迹采集、SFT 训练和 rollout 能力,依次完成评测、数据收集、return 计算、value model 训练、advantage 标注与策略更新。RECAP 特有的部分集中在 return、advantage 及 value model 的数据处理,其余能力均由已有组件提供;Workflow 则将这些阶段串联为可执行、可恢复的迭代过程。
当模型和环境完成一次适配后,开发者可以在数据采集、微调、评测与不同强化学习 workflow 之间传递数据、模型与 checkpoint,并按需编排新的后训练流程。实现类似 RECAP 的新算法时,只需补充算法特有的数据流与少量逻辑,无需重复集成端云基础设施。
以细粒度可复现 Recipe 打通具身落地的最后一公里
统一基础设施解决了流程搭建问题,但开发者仍需要知道:面对具体模型、环境和后训练目标,应如何选择配置并复现结果。verl-vla 将模型、环境、数据、资源拓扑、训练流程和评测协议固化为端到端 recipe;开发者可以直接运行参考配置,也可以在同一 workflow 中替换自己的模型、环境或算法。
下表列出了当前已验证的代表性 recipe。它们覆盖从 Web 遥操作与示范采集、监督微调,到 RECAP、DSRL 等强化学习后训练流程。
| Recipe | 模型与环境 | 流程 | 参考结果 |
| ACT Quick Start | ACT / LIBERO Spatial Task 0 | Web 采集 demonstration → SFT → TD3+BC | 成功率约从 40% 提升至 80% |
| PI0.5 SFT | PI0.5 / LIBERO Spatial | 监督微调与全任务评测 | 10 个任务共 100/100 成功,成功率 100% |
| PI0.5 RECAP | PI0.5 / LIBERO-10 Task 8 | 10 条 demonstration → 3 轮 RECAP | 16% 提升至 46%;相同数据池的 plain SFT 为 12% |
| Isaac GR00T RECAP | Isaac GR00T / Isaac Lab Arena GR1 | 两节点端云集群上的一轮 RECAP | 长程任务成功率 12% 提升至 34% |
| PI0.5 DSRL | PI0.5 / LIBERO Spatial | 在线 DSRL | Task 9:60%→82%;Task 2:74%→88% |
| Isaac GR00T DSRL | Isaac GR00T / Isaac Lab Arena LIBERO | 冻结基础 VLA,在线优化轻量 steering 模块 | Arena LIBERO Spatial Suite:10 个任务平均提升15.2% |
这些 recipe 为不同规模的 VLA、不同环境和不同后训练范式提供了可直接复用的起点,帮助开发者更快完成从环境接入到策略验证的闭环。

上图展示了 Isaac GR00T 使用 DSRL 方法在 Isaac Lab Arena LIBERO Spatial Suite 上的在线后训练效果。该 recipe 冻结基础 VLA 模型,仅通过在线 reward 优化轻量 steering 模块,在 10 个空间操作任务上实现了平均 15.2% 的成功率提升。这一结果验证了在不重训 GR00T 基础模型的前提下,借助 verl-vla 的端云协同闭环和 Isaac Lab 仿真器, 强化学习后训练持续改进策略表现的可行性。
NVIDIA 与 verl-vla 共建:打通策略、仿真与强化学习闭环
这次合作围绕 VLA 后训练的三个关键层次补齐能力:新的 VLA Policy Model、GPU 并行高保真仿真环境,以及轻量强化学习 recipe。三者通过 verl-vla 的统一接口独立接入,并可组合成端到端后训练工作流。
Isaac Lab Arena:连接社区具身智能 Benchmark 生态
在环境侧,Isaac Lab Arena 被集成到 verl-vla。它基于 NVIDIA Isaac Lab,提供 GPU 并行、高保真仿真,并由社区持续建设覆盖不同机器人、场景与技能的具身智能 benchmark。
所有基于 Isaac Lab Arena 构建的社区具身智能 benchmark,都可受益于 verl-vla 的环境接入、并行 rollout、数据记录、评测与后训练流程。随着社区贡献新的场景、机器人和任务,一次集成即可持续扩展 benchmark 覆盖面。
Isaac GR00T:新的 VLA Policy Model
合作将 Isaac GR00T 作为新的 VLA Policy Model 接入 verl-vla,支持在 LIBERO 和 Isaac Lab Arena 中完成微调、评测与强化学习后训练。
开发者因此可以在统一接口下复用 Isaac GR00T checkpoint,并按需组合不同环境、训练流程和 GPU 资源,无需维护独立脚本。
RECAP/DSRL:新的 VLA 强化学习 Recipe
在算法侧,合作将 RECAP(RL with Experience and Corrections via Advantage-conditioned Policies)和 DSRL(Diffusion Steering via Reinforcement Learning)引入 Isaac GR00T 与 PI0/PI0.5 的 Isaac Lab Arena pipeline。RECAP 结合策略自主执行经验与人工纠正数据,通过 return 和 advantage 信号训练 advantage-conditioned policy,使模型更倾向于复用高质量动作并从失败中持续改进。DSRL 保留基础 VLA 的既有能力,只训练轻量 steering 模块,并通过在线 reward 优化动作。
NVIDIA 与 verl-vla共同合作把数据采集、策略评测和分布式后训练串成可复现 recipe,通过GPU 并行仿真持续加速基础策略模型的训练优化。通过这些工作,Isaac GR00T、Isaac Lab Arena 、RECAP和 DSRL 在 verl-vla 中形成可复用组合。社区开发者可以从现有 checkpoint 和仿真任务出发,在同一套 API 下完成评测、数据收集、微调和强化学习,并继续扩展新模型、新环境与新 recipe。
verl-vla v0.1.0 正式发布
verl-vla v0.1.0 现已正式发布。作为构建在 verl 之上的统一 VLA 后训练框架,它让模型、环境与训练算法能够独立接入、按需组合,并贯通从人类示范和监督微调,到评测、强化学习与人类干预的完整后训练生命周期。
当前版本已支持 ACT、Gaussian Actor、PI0.5 和 Isaac GR00T 等策略模型,覆盖 LIBERO 与 Isaac Lab Arena 环境,并提供 SFT、SAC 风格 off-policy 训练、DSRL 和 RECAP 等后训练流程。开发者还可通过键盘、游戏手柄或 XR 控制器进行遥操作与干预,并通过浏览器实时观察环境状态与执行过程。
接下来,我们将继续扩展模型、环境、输入设备、后训练方法和端到端 recipe。其中,将真机训练纳入统一的端云后训练闭环,是后续的重要方向:让真实机器人能够与云端推理、数据采集、人类干预和持续优化更紧密地协同。欢迎访问 verl-vla GitHub 仓库 和项目文档,体验现有能力并参与共建。


