闭环训练与评估方案

1. Sim 数据采集

操作员佩戴 PICO 等 VR 设备,通过手柄和头显输入自身的位姿与操作意图。NVIDIA Isaac Teleop 将这些 VR 输入映射为仿真机器人在 Isaac Sim 中的控制指令,从而实现对仿真场景中机器人的遥操作。

在 Isaac Sim 中,预先配置好任务场景,比如机器人站在桌子前,抓取桌面上的轮子,将其放入旁边的盒子中。操作员完成任务的过程中,系统同步记录仿真环境产生的数据,包括相机图像、机器人关节状态、末端执行器位姿以及任务元数据等。这些 Episode 数据将被写入数据仓库,形成结构化的仿真 Demonstration Dataset。后续基于这些数据对模型进行微调。如下图所示:


2. 闭环执行

当前 VLA/WAM 策略通常采用 Action Chunking 形式:模型根据当前观测、机器人状态以及任务指令,预测固定的动作序列。该 Action Chunk 本身只表示短时局部行为,不等价于完成整个任务的完整轨迹,也通常不包含任务级终止判断。

因此,系统级执行采用 Closed-Loop:执行器每次执行当前 Action Chunk 的一部分或全部,然后重新获取环境观测和机器人状态,再次调用 VLA/WAM 策略生成新 Action Chunk。通过这种滚动式闭环执行,串联多个短时 Action Chunk,最终完成长时程任务。如下图所示:

2.1. 插件化

闭环执行框架采用可插拔的模块化设计,将观测获取、状态读取、策略推理和动作执行等能力抽象为独立组件。框架本身只定义统一的闭环执行流程,不与具体仿真平台、通信中间件或机器人本体强绑定。

不同后端可以通过插件方式接入。例如,可以为 Isaac Sim + ROS 2 实现一套插件,用于支持仿真环境中的闭环执行;也可以为不同机器人本体实现独立插件,用于适配其传感器布局、动作空间、控制频率和通信协议。通过这种设计,核心闭环逻辑可以保持稳定,系统只需替换或新增插件,即可扩展到新的仿真环境或机器人平台。


3. 仿真评估

训练数据由 Isaac Sim 仿真环境采集,模型微调后仍在 Isaac Sim 中通过闭环执行框架进行评估。

在闭环执行过程中,闭环框架通过 ROS 2 从 Isaac Sim 获取当前观测和机器人状态,然后调用部署在云端或机器人本体侧的模型推理服务,生成 Action Chunk。随后,闭环框架再通过 ROS 2 下发控制命令,使 Isaac Sim 中的机器人执行相应动作。

在 Sim 中进行评估的流程如下:

本体闭环执行的流程与 Sim 中类似。


4. Real2Sim 评估

Real2Sim 评估是指使用真实环境中采集的数据微调模型,然后将模型部署到仿真环境中进行闭环评估。该流程中,训练数据来自真实世界,而评估环境是可控、可复现的仿真场景。

Real2Sim 评估的主要价值在于,它可以在不频繁占用真实机器人、不引入真实环境安全风险的情况下,对基于真实数据训练出的模型进行大规模、可重复的评估。仿真环境可以方便地控制物体位置、场景布局、任务难度和扰动条件,从而系统性地测试模型的成功率、鲁棒性、泛化能力和失败模式。如下图所示:


5. 总体流程

整体流程可以分为三个阶段。

第一阶段是在仿真环境中采集数据。通过 VR 遥操作等方式在 Isaac Sim 中完成任务示范,采集相机图像、机器人状态、动作轨迹和任务元数据等仿真数据。这样做的好处是不占用真实机器人资源,也不会带来真实环境中的安全风险;只要云端具备足够的 GPU 资源,就可以并行构建场景、采集数据和训练模型,降低早期验证成本。

第二阶段是仿真评估。使用仿真环境中采集的数据微调模型,然后仍然在仿真环境中通过闭环执行框架进行评估。该阶段的目标是先打通完整链路,包括数据采集、模型训练、模型服务部署、闭环执行、动作下发和评估指标统计,验证系统架构和模型能力是否基本可行。

第三阶段是 Real2Sim 评估。使用真实环境中采集的数据微调模型,然后在仿真环境中进行闭环评估。它的好处是可以引入真实数据中的视觉分布、传感器噪声和操作行为特征,同时仍然利用仿真环境进行低成本、可重复、可控的评估。这样可以在进入真实机器人闭环测试之前,先筛选模型版本、发现明显失败模式,降低后续真机验证风险。

5.1. 模型侧与工程侧分工

整体工作可以拆分为模型侧和工程侧两部分。模型侧主要负责基于不同来源的数据进行模型微调与版本产出;工程侧主要负责数据采集链路、闭环执行框架和评估环境建设。

模型侧的核心工作是分别使用仿真数据和真实机器人数据对 VLA/WAM 模型进行微调,产出可部署的模型版本。仿真数据用于支持仿真评估;真实机器人数据用于支持 Real2Sim 评估和本体闭环执行。

工程侧负责构建和维护完整的执行与评估链路:

通过这种分工,模型侧可以专注于数据驱动的策略能力提升,工程侧则保证数据、仿真评估和机器人执行链路稳定可复用。