logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

10天速通强化学习-003--策略迭代、价值迭代

本节中需要明白的概念:上一节中我们讲到最优状态价值函数和最优动作价值函数,我们要理解,最优状态价值函数是所有的动作价值函数与其概率相乘的结果,所以可以很自然的想到,最优状态价值函数和最优动作价值函数的大小关系,一般来说前者大,若是后者大,则前者取后者(有点废话了)还有一点要明白:策略变化,状态价值函数和动作价值函数会跟着变化。

文章图片
#人工智能#python
px4+mavros+ros+Prometheus

安装ubuntu20.04修改源安装搜狗。

#prometheus#无人机
10天速通强化学习-001--MAB、贪心、上置信界、汤普森采样

数据的稳定性,监督学习数据稳定不变,强化学习数据从外界获得一直在变。

文章图片
#人工智能
10天速通强化学习-006--DQN、Double DQN、Dueling DQN

Double DQN :缓解了DQN中对Q值的过高估计Dueling DQN:能够很好地学习到不同动作的差异性,动作空间大时非常有效这可以作为创新点来发掘,记住从DQN到Double DQN (解决现有问题Q值过高)和 Dueling DQN(解决不同动作模式的差别)的转变。r+r+r+%5Ceta。

文章图片
#机器学习#人工智能
双系统ubuntu20.04不能外接显示器的解决办法

首先确定是不是英伟达显卡驱动,如果不是的话,设置里找到附加驱动,更改为NVIdia类型的驱动,更改完成之后重启这里大部分电脑都可以了,如果不行。

#ubuntu
10天速通强化学习-006--DQN、Double DQN、Dueling DQN

Double DQN :缓解了DQN中对Q值的过高估计Dueling DQN:能够很好地学习到不同动作的差异性,动作空间大时非常有效这可以作为创新点来发掘,记住从DQN到Double DQN (解决现有问题Q值过高)和 Dueling DQN(解决不同动作模式的差别)的转变。r+r+r+%5Ceta。

文章图片
#机器学习#人工智能
到底了