Minghui Wang, Bi Zeng, Quijie Wang. Research on motion planning based on flocking control and reinforcement learning multi-robot systems[J]. machines,2021.9.

multi-robot motion planning system structure

这篇文章采用了La.首次提出的上下层级控制器(相关论文详见上一篇阅读笔记),上层为强化学习行为策略提供,下层为集群控制器,是La系统的一个再发展。
强化学习用以增强机器人的分析、预测和寻找合适动作的能力。控制系统结构如下图所示:
在这里插入图片描述
3.1多智能体集群移动控制
集群的定义主要有以下三部分组成:
1)可分性(separability):集群内部防撞;
2)凝聚力(cohesiveness):所有成员收敛到一个平均位置;
3)排列(permutation):每个成员一起想相同位置运动。
集群运动有两种类型:1)无领导集群运动;2)有领导集群运动。这篇文章采用的是主从式。
3.2主从式集群控制设计
整体控制律设计基于人工势场设计,具体过程不多赘述,有兴趣的自己可以取看原文。
3.3队形变换
为了更好的应对突发的紧急情况,需要有队形变换模块。
当编队中的成员势函数出现极大排斥力时,队形需要紧急变为更为安全的队形(例如经过窄缝时,从钻石型变为一纵列),当离开危险环境时,将变回初始队形。
3.4沿墙运动控制
在凹形障碍物等一些有障碍物的复杂环境下,势场很容易陷入局部最优解或振荡点。采用沿墙运动控制,即使机器人只知道局部环境信息,可以避免陷入局部最优问题中。
控制方法如图所示:
在这里插入图片描述
公式为:
在这里插入图片描述
在这里插入图片描述

基于动作的机器人的强化学习算法

基于行为的控制策略需要在运行过程中实时获取局部环境信息来进行运动:向目标运动,避撞和沿墙运动。这篇文章中,强化学习用于解决如何让智能体在与环境交互过程中使用学习策略来获得最大汇报的问题。
这篇文章采用Q-learning算法。
强化学习的价值函数如下定义
在这里插入图片描述
Vπ(st)V^\pi (s_t)Vπ(st)称为使用策略π\piπ从初始状态获得的转换sss的累计回报。
在每次迭代学习中,Q function可如下获得:
在这里插入图片描述
max⁡Q(st+1,a)\max Q(s_{t+1},a)maxQ(st+1,a)代替V(st+1)V(s_{t+1})V(st+1),则上式变为
在这里插入图片描述
进一步将更新Q value如下所示
在这里插入图片描述
Q-learning在以下条件下收敛:
1)环境时马尔科夫过程;
2)检查用于表现Q function;
3)每个state-action pair可以在实验中无限次重复;
4)需要正确选择学习率。
学习率的界限如下所示:
在这里插入图片描述
强化学习模块返回以下两种强化学习信号:1)比较机器人和目标之间当前距离和前一时刻距离;2)比较机器人和障碍物之间当前时刻和前一时刻距离。
与目标之间距离的赏罚函数为:
在这里插入图片描述
与障碍物之间距离的赏罚函数为:
在这里插入图片描述
为了探索所有的动作,在初始阶段,采用玻尔兹曼分布进行随机选择动作。动作选择如下表示:
在这里插入图片描述
在学习过程中,根据贪心策略选择当前状态下最大Q-value的对应动作:
在这里插入图片描述
基于行为的机器人的强化学习算法步骤如下:
1)获取机器人当前的状态;
2)获取随机值;
3)基于Boltzmann分布获取随机动作或者采用贪心策略获取动作;
4)执行动作;
5)获得新的状态;
6)给强化学习模型输入新的状态,获得强化信号;
7)根据强化信号和Q function的更新公式更新Q value。

总结

之所以精读这篇论文是因为我希望找到一个可以对集群控制进行全面优化的强化学习算法,但有希望整体框架基于固定模型,也就是说,强化学习只用于优化。

Logo

腾讯云面向开发者汇聚海量精品云计算使用和开发经验,营造开放的云计算技术生态圈。

更多推荐