基于局部反馈的随机多射击方法提升轨迹优化样本效率
随机单射击轨迹优化方法,如模型预测路径积分控制(MPPI),由于能够处理概率动力学,并在模型梯度噪声大、评估代价高或不可用时提供解决方案,已在机器人领域得到广泛应用。然而,当对长动作序列进行射击时,终端约束的满足往往样本效率低下,需要大量迭代才能收敛。
为克服这一局限,我们提出了一种随机多射击方法,通过局部反馈策略连接短控制动作序列进行优化。通过将长时域问题划分为较短片段,并利用局部反馈策略对各片段进行稳定,该方法显著提高了样本效率和终端集收敛速度,因为局部策略为每个片段提供了更好的引导。
我们方法的一个关键创新在于,完全从轨迹(rollouts)中合成近似系统雅可比矩阵,无需显式模型梯度。这使得该方法可直接应用于具有黑盒动力学的基于模型的强化学习,其中梯度通常不可用或代价高昂。这一能力拓宽了该方法在更广泛机器人系统中的应用前景。
我们在三个非线性、欠驱动优化问题上验证了该算法:经典的cartpole摆起任务(具有解析动力学)、相同任务但使用学习到的神经网络动力学,以及VTOL四平面飞行器进行高攻角、精密失速着陆机动。在所有案例中,与随机单射击基线相比,我们的方法均表现出更高的样本效率和更好的终端集收敛性。
结果表明,带有局部反馈策略的随机多射击方法为复杂不确定环境中的轨迹优化提供了鲁棒且高效的框架。未来工作将探索将该方法扩展到实时控制和更大规模问题。