logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

强化学习(赵世钰版)-学习笔记(完)(10.Actor-Critic方法)

最后是确定性的(Deterministic)Actor-Critic算法,之前的算法可以成为随机版本的,因为每个状态下各行为发生的概率都不为零。其中这个行为值的获取方法有两种,一个是用MC的方法获取(上节课介绍的),叫REINFORCE方法。这个是A2C算法的伪代码,这是个On-Policy的算法,因为用到的采样数据,也是用这个策略得到的。对A2C算法的方程进行数学变换,也能获取到一个β,跟上节课

文章图片
#学习
强化学习(赵世钰版)-学习笔记(6.随机近似与随机梯度下降)

简单示例给了一个正切函数,可以看出这个误差乘以系数后,差异可以对原估计值进行修正,最后总会收敛到目标点,严格意义的证明没仔细看,太数学化,很繁琐。将这个估算期望值的增量方法进行泛化,可以获得一个随机近似的通用算法,深度学习中的随机梯度下降法,本质上也是这类随机近似的算法。这里证明了该思路的可行性,在数据增加的过程中,期望值变化的规律,可以看出添加一个新的采样后,期望值的变化是有规律的。Robbin

文章图片
#学习
基于深度学习的视觉目标跟踪进展综述

尽管以上的双路网络方法在视频目标跟踪中取得了很大的成功,但是仍然存在缺陷,缺少在线更新过程.MemTrack、Meta-Tracker、Re2EMA、UpdateNet和GradNet等, 提出了不同的模板更新算法。双路网络框架(SiamFC),此方法利用卷积网络提取目标模板和搜索区域的特征,然后再进性相关操作生成响应图,其中响应图上的峰值点就是目标所在的位置。深度学习提取特征的特点是,高层的语义

文章图片
#目标跟踪#人工智能#计算机视觉
从零实战SLAM-第十课(回环检测与建图)(完)

验证两帧之间的相似度,有以下几种常用的策略,其中基于外观的方法是主流,核心在于衡量两帧图像之间的相似度。SLAM的前段和后端都存在误差,因为建图与定位是耦合的,所以整个误差会积累。➢ 对每一个样本,计算与每个中心点之间的距离,取最小的作为它的归类;➢ 思路:相邻关键帧是相似的,而回环的相似度应该约等于相邻关键帧。BoW的字典生成问题亦属于其中之一,N个特征点,归为k个单词。回环检测是通过检测出之前

文章图片
#计算机视觉#图像处理
强化学习(赵世钰版)-学习笔记(3.最优策略与贝尔曼最优方程)

这个方程中的r,p(r|s,a),p(s'|s,a)等都是已知的,这表明整个环境信息是已知的,各状态的状态值是未知的,状态值的作用就是用于衡量两个策略之间的优劣,如果对于同一个环境下,对于所有的状态s,策略Pi1的状态值均大于策略Pi2,则可以说策略Pi1由于策略Pi2,以下是相关的数学描述。贝尔曼最优方程,可以记作一个关于状态值v的方程,就是下面的v=f(v),因为前面的R_pi是当前状态下动作

文章图片
#学习#算法
DEEPFILTERNET 阅读笔记

德国学者提出轻量级语音降噪模型DeepFilterNet,采用两阶段深度滤波方法:第一阶段基于ERB增益增强频谱包络,第二阶段通过深度滤波强化语音周期成分。该模型采用可分离卷积等设计降低计算复杂度(仅0.35G MACS),在5-30ms窗口下性能优于传统复掩码方法,WB-PESQ达2.81。实验表明其与先进模型性能相当但计算效率更高,特别适合实时应用。研究验证了深度滤波在低延迟场景的有效性,为资

文章图片
强化学习(赵世钰版)-学习笔记(5.蒙特卡罗法)

MC Basic算法是基于蒙特卡罗算法的相对最简单的方法,它是基于值迭代法改进的方法,将其中的行为值计算这一步,改用采样的样本进行估计,而不是直接用模型参数计算(因为模型参数可能是未知的)。常用的策略分为两种,一个是确定性的策略,比如贪心策略,每次都选概率最大的。一个是随机性策略,比如软策略。为什么要引入软策略,目的就是一个回合足够的长,那么就会访问到所有的状态-行为对,这样就避免了大量的回合采样

文章图片
#学习#机器学习
无人驾驶实战-第十二课(强化学习自动驾驶系统)(完)

模仿学习: 从专家提供的范例中学习,一般提供人类专家的决策数据, 每个决策包含状态和动作序列, 把状态作为特征,动作作为标记进行分类或回归的学习从而得到最优策略模型。Q-Table为每一个 state 上进行的每一个 action 计算出最大的未来 reward 的期望,每个状态允许四种可能的操作:左移、右移、上移、下移, Table 里的参数式给定最佳策略的状态下采取相应动作获得的最大未来奖励期

文章图片
#自动驾驶#人工智能#机器学习
强化学习(赵世钰版)-学习笔记(4.值迭代与策略迭代)

所以在做策略迭代的时候,这里要设置一个阈值j,迭代次数大于J的迭代操作予以舍弃,这叫做截断的策略迭代算法(truncated policy iteration algorithm)。策略迭代的初始是一个随机的策略,值迭代的初始是一个随机的状态值。因为采用贪心的思路,这个新的值V_k+1等价于最优的行为值(行为值最大的行为,采用的概率为100%,其余的为0%,就能得到最大值)。第四步的计算是有差异的

文章图片
#学习#算法
《深度学习之PyTorch物体检测实战》读书笔记(二)神经网络的基本组成

第二章是Python基础,笔记省略深度学习中常见的各种层卷积的本质是用卷积核的参数来提取数据的特征,通过矩阵点乘运算来得到结果。激活函数层的作用是为网络引入非线性,提升整个网络的表达能力。Sigmoid函数Sigmoid可以用来做二分类,但计算量较大,且容易出现梯度消失的现象。ReLU函数计算简单速度快。Leaky ReLUctant函数效果没有ReLU好。Softmax函数用于多分类问题。池化层

    共 16 条
  • 1
  • 2
  • 请选择