logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

强化学习从PG到PPO(基于百度飞桨PaddlePaddle+PARL)

前段时间抽空学习了《百度强化学习基础课程》强化学习7日打卡营-世界冠军带你从零实践,总共七天的视频+线上作业(视频地址:世界冠军带你从零实践强化学习),让我这个小白基本对于强化学习有了简单的理解,知识虽然是灌进脑袋里,但仍是一团浆糊,本篇文章整理了自己的对于课程的理解,以及自己的发散和思考,从最简单的PG算法,到现在流行的PPO算法。PG算法原理PG算法即是基于策略(Policy-based),不

基于强化学习预算约束出价:Budget Constrained Bidding by Model-free ReinforcementLearning in Display Advertising

基于强化学习预算约束出价问题的主要挑战在于如何精细地调整出价系数,以在满足客户预算约束的前提下最大化目标价值。传统的做法是通过线性规划求解预算约束出价问题,本文介绍一种基于强化学习的预算约束出价策略。该策略采用model-free Online DQN方式,通过一个拍卖系统仿真平台进行决策网络的训练和动作探索。

文章图片
#人工智能
【机器学习算法笔记】0. 机器学习算法分类

【机器学习算法笔记】0. 机器学习算法分类0.1 凸优化问题凸优化是指一种比较特殊的优化,是指求取最小值的目标函数为凸函数的一类优化问题。其中,目标函数为凸函数且定义域为凸集的优化问题称为无约束凸优化问题。而目标函数和不等式约束函数均为凸函数,且定义域为凸集的优化问题为约束优化问题。凸优化问题的特性:1、凸问题的局部最优解就是全局最优解。2、许多非凸问题通过一定的手段可以化归为凸问题。3、

#机器学习
【机器学习算法笔记】2. 学习算法与最小均方算法(LMS)

【机器学习算法笔记】2. 学习算法与最小均方算法(LMS)最小均方算法是一个非常流行的在线学习算法。其是建立在自适应滤波和自适应调整权重上的。2.1 迭代下降思想三种以迭代下降思想为基础的无约束最优化方法:2.1.1 最速下降法:在最速下降法中,对权值向量的调整是在最速下降的方向进行的,即它是与梯度向量方向相反的,梯度向量记为:最速下降法一般表示为:其原理是根据一阶泰勒展开式:

#机器学习
【机器学习算法笔记】1. 回归器模型

【机器学习算法笔记】1. 回归器模型回归算法是试图采用对误差的衡量来探索变量之间的关系的一类算法。回归算法是统计机器学习的利器。常见的回归算法包括:最小二乘法(线性回归),逻辑回归,逐步式回归,多元自适应回归样条等。1.1 线性回归器所谓线性回归:对于一组输入值X=[x1,x2,…,xn],存在输出y,为了代表输入与输出的函数关系,假定输出估计线性回归器所要求的问题:一元线性回归

#机器学习
编写C语言版本的卷积神经网络CNN之二:CNN网络的总体结构

卷积神经网络是深度学习的基础,但是学习CNN却不是那么简单,虽然网络上关于CNN的相关代码很多,比较经典的是tiny_cnn(C++)、DeepLearnToolbox(Matlab)等等,但通过C语言来编写CNN的却比较少,本人因为想在多核DSP下运行CNN,所以便尝试通过C语言来编写,主要参考的代码是DeepLearnToolbox的内容,DeepLearnToolbox是用Matlab脚本编

#神经网络#cnn#c语言
编写C语言版本的卷积神经网络CNN之四:CNN的学习及测试结果的比较

原创文章转载请注册来源http://blog.csdn.net/tostqTips:      关于在线学习和批量学习      批量学习方法:突触权值的调整在训练样本集合的所有N个例子都出现后进行,这个N个例子构成训练的一个回合,每个回合的训练样本的样例都是随机选择的,而权值的调整是靠所有N个例子的总体平均来实现。批量学习方法的优点在于能够精确估计当前梯度向量(即代价

#c语言#cnn
强化学习DDPG:Deep Deterministic Policy Gradient解读

DDPG是基于Q-learning的,其由于是取最大可能性的某个确定动作,因此可能会带来Maxinum偏差(简单理解为由于预估分布的存在,所以最大值一般都会偏移期望值),这个问题可能通过double Q-learning进行解决。Twin Delayed DDPG又被称为TD3算法..由于DDPG只能产出确定性动作,因此Soft Actor Critic (SAC) 实现产出概率性动作决策stoc

文章图片
#人工智能#机器学习#深度学习
强化学习PPO:Proximal Policy Optimization Algorithms解读

PPO算法是一类Policy Gradient强化学习方法,通过一个参数化决策模型来根据状态确定动作,其参数更新是通过下式进行的:用于衡量决策模型的优劣目标,决策模型的优化目标为寻找最优决策,使得该决策下整体价值最大。因为最优决策是未知的,一种简单思路是直接当前参数模型进行寻优。称为Vanilla Policy Gradient。TRPO:Trust Region Policy Optimizat

文章图片
#算法
强化学习笔记-05 蒙特卡罗方法Monte Carlo Method

本文是博主对《Reinforcement Learning- An introduction》的阅读笔记,不涉及内容的翻译,主要为个人的理解和思考。蒙特卡罗方法,weighted importance sampling,off-policy蒙特卡罗方法,

文章图片
    共 32 条
  • 1
  • 2
  • 3
  • 4
  • 请选择