Nvidia Isaac Lab 7 - 在 Isaac Lab 中,训练第一个机器人 - 4. 任务设计与马尔可夫决策过程
现在进入使用 Isaac Lab 训练物理 AI 的核心内容:基于马尔可夫决策过程(Markov Decision Process,MDP)框架设计任务和奖励。该框架中的主要组成部分将直接对应到代码中的各个部分。
1. 马尔可夫决策过程
马尔可夫决策过程用于对决策过程建模。在这个过程中,智能体通过与环境交互,学习如何做决策,而环境在一定程度上受到智能体的控制。
站在高层次看:智能体在环境中采取动作,通过状态描述环境;每次动作之后,智能体都获得奖励;目标是训练出能够最大化奖励的策略。

智能体就是机器人,环境可能是桌子以及机器人周围的道具。动作可能是移动机器人关节,或闭合夹爪。观测可能是角度、速度,或场景中的某些组成部分。观测可以理解为对环境完整状态的部分观察。
MDP 框架中的不同组件将由用户定义,用于让智能体完成指定任务。本质上,这些组件直接对应到 Isaac Lab 代码中的各个部分。

注意
当把策略部署到真实的物理机器人上时,从哪里获取观测呢?
在物理机器人上,观测数据可能来自各种传感器,比如位置编码器、距离传感器、IMU(惯性测量单元)、力传感器、摄像头,或其他设备。
在仿真中,甚至可以访问“特权数据”。比如获取在真实世界中很难甚至几乎不可能测量的数据。这对于根据真实值评估训练效果非常有价值。
2. 在 Isaac Lab 中使用 MDP 定义任务
下面看如何在 Isaac Lab 中实现这些概念。配置这些内容是进行训练的第一步。
- 智能体资产:在本例中,是现有 USD(Universal Scene Description,通用场景描述)资产,用于表示某种特定的机械结构或机器人。
- 环境:可以是 USD 资产,也可以是生成的资产,比如程序化地形,它们将被放置在仿真场景中。
以及定义函数,用于确定:
- 在每个仿真步中,如何计算奖励?
- 如何判断任务是否结束?
- 如何重置仿真?
