logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

深度强化学习笔记06【总结:DDPG/TD3/SAC】

总结:1)DDPG解决DQN难以处理连续动作空间问题:DDPG = DQN + DPG;2)TD3解决过估计Q值问题:TD3 = DDPG + clipped double-Q learning + "delayed" policy updates + target policy smoothing;3)SAC将SPG与DDPG结合:SAC = DDPG + SPG + clipped doubl

文章图片
#深度学习#机器学习#人工智能 +1
深度强化学习笔记02【DDPG】

DQN不便解决连续动作空间问题,因为其算法中回归拟合方程存在max问题,所以仅适用于离散动作空间,DDPG借助DPG的思想,利用actor输出唯一action作为critic的输入,能够使得critic的输出Q值最大,此外DDPG还沿用了DQN中的target network和relay buffer

文章图片
#深度学习#机器学习
深度强化学习笔记02【DDPG】

DQN不便解决连续动作空间问题,因为其算法中回归拟合方程存在max问题,所以仅适用于离散动作空间,DDPG借助DPG的思想,利用actor输出唯一action作为critic的输入,能够使得critic的输出Q值最大,此外DDPG还沿用了DQN中的target network和relay buffer

文章图片
#深度学习#机器学习
到底了