Nvidia Isaac Lab 7 - 在 Isaac Lab 中,训练第一个机器人 - 4. 任务设计与马尔可夫决策过程

现在进入使用 Isaac Lab 训练物理 AI 的核心内容:基于马尔可夫决策过程(Markov Decision Process,MDP)框架设计任务和奖励。该框架中的主要组成部分将直接对应到代码中的各个部分。


1. 马尔可夫决策过程

马尔可夫决策过程用于对决策过程建模。在这个过程中,智能体通过与环境交互,学习如何做决策,而环境在一定程度上受到智能体的控制。

站在高层次看:智能体环境中采取动作,通过状态描述环境;每次动作之后,智能体都获得奖励;目标是训练出能够最大化奖励的策略

智能体就是机器人,环境可能是桌子以及机器人周围的道具。动作可能是移动机器人关节,或闭合夹爪。观测可能是角度、速度,或场景中的某些组成部分。观测可以理解为对环境完整状态的部分观察。

MDP 框架中的不同组件将由用户定义,用于让智能体完成指定任务。本质上,这些组件直接对应到 Isaac Lab 代码中的各个部分。

注意

当把策略部署到真实的物理机器人上时,从哪里获取观测呢?

在物理机器人上,观测数据可能来自各种传感器,比如位置编码器、距离传感器、IMU(惯性测量单元)、力传感器、摄像头,或其他设备。

在仿真中,甚至可以访问“特权数据”。比如获取在真实世界中很难甚至几乎不可能测量的数据。这对于根据真实值评估训练效果非常有价值。


2. 在 Isaac Lab 中使用 MDP 定义任务

下面看如何在 Isaac Lab 中实现这些概念。配置这些内容是进行训练的第一步。

以及定义函数,用于确定: