logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

机器学习(二十九)——Temporal-Difference Learning

https://antkillerfarm.github.io/Temporal-Difference Learning(续)TD vs. MC—3再来看如下示例:已现有两个状态(A和B),MDP未知,衰减系数为1,有如下表所示8个完整Episode的经验及对应的即时奖励,其中除了第1个Episode有状态转移外,其余7个均只有一个状态。Episode状态转...

机器学习(二十七)——Q-learning, 动态规划

http://antkillerfarm.github.io/Q-learningQ-learning是强化学习中很重要的算法,也是最早被引入DL领域的强化学习算法,对它的研究催生了Deep Q-learning Networks。下面用一个例子来讲述Q-learning算法。上图中有5个房间,编号为0~4,将户外定义为编号5,房间之间通过门相连,则房间的联通关系可抽象为下图:...

机器学习(十一)——机器学习中的矩阵方法(1)LU分解、QR分解

机器学习(十一)——机器学习中的矩阵方法(1)LU分解、QR分解

#机器学习
机器学习(三十四)——策略梯度

策略梯度价值函数可以进行近似的参数化表达,策略本身也同样可以函数化、参数化:πθ(s,a)=P[a∣s,θ]\pi_\theta(s,a)=P[a | s, \theta]πθ​(s,a)=P[a∣s,θ]所谓函数化是指,通过一个概率分布函数πθ(s,a)\pi_\theta(s,a)πθ​(s,a),来表示每一步的最优策略,在每一步根据该概率分布进行action采样,获得当前的最佳acti...

深度学习(四十二)——深度强化学习(5)PPO, IMPALA, Hierarchical RL, OpenAI

PPO(Proximal Policy Optimization)PPO是2017年由OpenAI提出的一种基于随机策略的DRL算法,也是当前OpenAI的默认算法。PPO是一种Actor-Critic算法。它的主要改进在它的Actor部分。我们知道,Policy Gradient算法的训练过程中,始终存在着new Policy和old Policy这样一对矛盾。一方面,我们需要new P...

深度学习(四十一)——深度强化学习(4)A2C & A3C, DDPG

A2C & A3CActor-Critic一般简称AC算法。针对它的一般用法参见《机器学习(三十五)》。AC算法也可用于DRL领域,具体的做法和DQN类似:一个Actor网络,用来近似V值。一个Critic网络,用来近似Q值。这里有个小技巧:Actor网络和Critic网络可以共享网络参数,两者仅最后几层使用不同结构和参数。(参见下图A3C的图)针对AC的改进,衍...

深度学习(二十)——Ultra Deep Network, 图像超分辨率算法

http://antkillerfarm.github.io/Ultra Deep NetworkFractalNet论文:《FractalNet: Ultra-Deep Neural Networks without Residuals》Resnet in Resnet论文:《Resnet in Resnet: Generalizing Residual Ar...

机器学习(二十三)——Beam Search, NLP机器翻译常用评价度量, 模型驱动 vs 数据驱动

机器学习(二十三)——Beam Search, NLP机器翻译常用评价度量, 模型驱动 vs 数据驱动

#机器学习
深度学习(四十一)——深度强化学习(4)A2C & A3C, DDPG

A2C & A3CActor-Critic一般简称AC算法。针对它的一般用法参见《机器学习(三十五)》。AC算法也可用于DRL领域,具体的做法和DQN类似:一个Actor网络,用来近似V值。一个Critic网络,用来近似Q值。这里有个小技巧:Actor网络和Critic网络可以共享网络参数,两者仅最后几层使用不同结构和参数。(参见下图A3C的图)针对AC的改进,衍...

    共 107 条
  • 1
  • 2
  • 3
  • 11
  • 请选择