logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Unity3D ML-Agent-0.8.1 学习四(模仿学习)

Unity3D Ml-Agent-0.8.1 学习四(模仿学习)写的目的场景设置修改配置并训练总结写的目的本篇介绍模仿学习,即玩家边玩,代理边学习,主要分为在线学习和离线学习,在线就是跟着师傅一起学,离线就是看是师傅录制的资料学习,我们主要讲在线学习,就是玩家边玩,AI边学习,可以实时观察学习的效果,离线学习只是记录玩家信息,产生生成一个文件,命令行学习文件即可,不多做介绍。场景设置可以...

#深度学习
李宏毅机器学习系列-强化学习之Q-Learning

李宏毅机器学习系列-强化学习之Q-Learning评判家(Critic)怎么衡量$V^\pi(s)$蒙特卡洛法(MC)时序差分算法(TD)MC和TD对比另一种评判$Q^\pi(s,a)$Q-Learning目标网络的训练探索缓存(Replay Buffer)算法总结评判家(Critic)评判家基于价值的一种学习方式,我们前面说的是基于策略的。评判家在评判什么呢,他不想策略决定我们要用什么ac...

#深度学习
李宏毅机器学习系列-分类-概率生成模型

李宏毅机器学习系列-分类:概率生成模型分类及其应用宝可梦分类案例用回归来做分类概率模型先验概率多元高斯模型极大似然估计改进后验概率总结分类及其应用分类简单来说就是你输入一个x,经过一个函数,给你输出一个值n,即属于哪个类,n是个离散的数值:主要应用有:信用评分:比如你去贷款,他会根据你的收入,存款,职业,年龄等因素来评估是否要贷款给你。医疗诊断:根据当前的症状,年龄,以往病史,来推断可...

#分类#机器学习#深度学习
李宏毅机器学习系列-强化学习之近端策略优化PPO

李宏毅机器学习系列-强化学习之近端策略优化策略梯度的另一个问题策略梯度的另一个问题上一篇深度强化学习介绍到,我们的奖励梯度是这个样子:这个就意味着,在同一场游戏里不同的sts_tst​下,采取某个ata_tat​的权重有一个相同的R(τn)R(\tau^n)R(τn),这显然是有问题的。比如如果某个R(τn)R(\tau^n)R(τn)好,并不意味着他里面的a都好,要提高出现的概率,相反R...

#深度学习
深度学习-李宏毅GAN学习之InfoGAN,VAE-GAN,BiGAN

深度学习-李宏毅GAN学习之InfoGAN,VAE-GAN,BiGAN提出问题InfoGANVAE-GANBiGAN总结提出问题我们知道最基本的GAN就是输入一个随机的向量,输出一个图片。以手写数字为例,我们希望修改随机向量的某一维,能改变数字的特想,比如角度,粗细,数字等,但是实际上貌似没什么大的影响,下图就是个例子,貌似看不到某一维度的具体含义,如下图:我们可能直观的会认为每个维度应该...

#深度学习
李宏毅机器学习系列-半监督学习

李宏毅机器学习系列-半监督学习什么是半监督学习半监督学习的假设生成模型上的半监督学习Low-density Separation非黑即白自学习熵正则化半监督SVMSmoothness Assumption(平滑假设)Better Representation总结什么是半监督学习顾名思义应该是一般有标签,一般没标签吧,差不多,只是没标签的占大多数,比如下图,我们有6张图,只有两张是有标签的,另外..

#机器学习#深度学习#人工智能
深度学习-李宏毅GAN学习之InfoGAN,VAE-GAN,BiGAN

深度学习-李宏毅GAN学习之InfoGAN,VAE-GAN,BiGAN提出问题InfoGANVAE-GANBiGAN总结提出问题我们知道最基本的GAN就是输入一个随机的向量,输出一个图片。以手写数字为例,我们希望修改随机向量的某一维,能改变数字的特想,比如角度,粗细,数字等,但是实际上貌似没什么大的影响,下图就是个例子,貌似看不到某一维度的具体含义,如下图:我们可能直观的会认为每个维度应该...

#深度学习
深度学习-李宏毅GAN学习之fGAN

深度学习-李宏毅GAN学习之fGAN散度函数散度函数共轭函数(Fenchel Conjugate)一些问题Mode CollapseMode Dropping总结散度函数上一篇讲了GAN的数学原理,这次继续深入。这次讲fGan,也就是将GAN的散度函数的统称,上篇将了2个散度,KL散度和JS散度,当然GAN还有其他的散度函数。上图所示,我们可以将散度函数统一定义为上面这个公式,f()就是...

#生成对抗网络#深度学习
深度学习-李宏毅GAN学习之VAE

深度学习-李宏毅GAN学习之VAEVAE(变分自编码器)直觉解释VAE直觉架构VAE数学解释高斯混合模型拟合VAE分布映射最大似然估计总结VAE(变分自编码器)直觉解释普通的自编码器大家已经比较熟悉了,比如输入一张图片,然后提取出一个向量,最后再复原回图片。就如下图,我们有两张图片,都编码成一个code,然后可以复原,但是如果我们取了中间的code,应该是什么呢,虽然我们会认为应该是中间的插...

#深度学习#机器学习
图解深度学习-梯度下降法优化器可视化(SGD, Momentum,Adam, Adagrad and RMSProp)

图解深度学习-梯度下降法可视化(SGD, Momentum, Adagrad and RMSProp)前言定义了4个基本函数机器学习原理原始的梯度下降算法带动量的梯度下降算法带惯性的梯度下降算法Adagrad 自适应调整的梯度下降RMSPropAdam前言主要用了Jupyter Notebook的插件ipywidgets,可以进行交互,可以自己调整参数来看结果,用于理解来说非常好,今后也会继续..

#深度学习#机器学习#人工智能
    共 37 条
  • 1
  • 2
  • 3
  • 4
  • 请选择