
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
【文献学习】强化学习2:基于策略函数的方法
参考文献:[1]《强化学习》,邹伟,等.(鳄鱼书)随机策略梯度(其实这一部分我没看懂,整理下来还是乱,但愿有懂的大神愿意教教我)策略梯度的优点:1.适用于连续动作空间场景;2.策略搜索方法具有更好的收敛性;2.策略搜索方法更简单;3.策略搜索方法可以学到随机策略。只有针对状态可完美观测或使用的特征可以完美描述状态的情况,才有对于任何MDP总有一个确定性策略当发生状态崇明无法区分或使用的近似函数里描
【文献学习】基于动作规划和强化学习的多智能体集群
采用强化学习作为局部路径规划,动作选择的策略供应器,整体集群算法采用势函数法。是La.文章的再发展。
使用axmath如何给公式编号右对齐
先点击插入编号,再在编号前键入tab
到底了







