
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
深度强化学习笔记06【总结:DDPG/TD3/SAC】
总结:1)DDPG解决DQN难以处理连续动作空间问题:DDPG = DQN + DPG;2)TD3解决过估计Q值问题:TD3 = DDPG + clipped double-Q learning + "delayed" policy updates + target policy smoothing;3)SAC将SPG与DDPG结合:SAC = DDPG + SPG + clipped doubl

深度强化学习笔记02【DDPG】
DQN不便解决连续动作空间问题,因为其算法中回归拟合方程存在max问题,所以仅适用于离散动作空间,DDPG借助DPG的思想,利用actor输出唯一action作为critic的输入,能够使得critic的输出Q值最大,此外DDPG还沿用了DQN中的target network和relay buffer

深度强化学习笔记02【DDPG】
DQN不便解决连续动作空间问题,因为其算法中回归拟合方程存在max问题,所以仅适用于离散动作空间,DDPG借助DPG的思想,利用actor输出唯一action作为critic的输入,能够使得critic的输出Q值最大,此外DDPG还沿用了DQN中的target network和relay buffer

到底了







