logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Deep RL learning[2026/8] Policy Gradient:从原理到优化技巧

在强化学习的浩瀚海洋中,我们最熟悉的莫过于 Q-Learning 和 DQN。这类算法属于方法,即先学习状态的价值,再根据价值选动作。但在很多复杂场景(如机器人控制、大型策略空间)中,直接学习策略往往更直观、更有效。这就是方法的由来。今天我们就来聊聊其中的经典——,并重点剖析两个让他“脱胎换骨”的技巧。

#人工智能
强化学习【value iterration】【python]

值迭代(Value Iteration)是解决马尔可夫决策过程(MDP)的经典动态规划算法。其核心基于,通过迭代方式求解最优价值函数。1.2矩阵形式V(s)r(s,a)通过采取行动a目的是找到最优策略使得状态值V最大通过contraction mapping 理论,可知道最优状态值可以通过迭代更新求解。

#算法
PPO- BipedalWalkerHardcore-v3

作为 Gym 中最硬核的机器人控制任务之一,BipedalWalkerHardcore-v3 对强化学习算法的鲁棒性提出了严峻考验。其训练曲线在后期呈现明显的高方差特性,这也使其成为剖析 PPO 参数细节与调试策略的理想案例。我们将以此为切入点,记录一次完整的调参与优化实战。

#人工智能#算法
【PyTorch][chapter 28][李宏毅深度学习][Diffusion Model-3]

生成模型里面发展: AE->VAE->GAN ->WGAN -> Diffusiong本篇我们重点是推导一下Diffusion 模型用的3个公式:下面红色的是用到了VAE重采样的原理。

文章图片
#人工智能
机器学习-Ridge 岭回归

前言:当alpha 值为0,求解过程和最小二乘法是一样的优点:可以防止矩阵不可逆惩罚某个维度权重系数过高一 岭回归原理输入:m个样本,n个维度: 标签值模型其中w 为权重系数 [n,1]求解:w...

文章图片
【PyTorch][chapter 25][李宏毅深度学习][ CycleGAN]【实战】

参数配置是通过argparse 实现的,这样通过google colab 调试的时候。文件目录:options\train_options.py。CycleGAN 是先训练生成器G, 再训练鉴别器D。论文中直接提供了GitHub 的代码下载地址。GAN 模型是先训练鉴别器D, 再训练生成器G。主要定义了生成器,鉴别器的网络结构。6:训练和测试代码。4: network代码。define_G生成器。

文章图片
#深度学习#pytorch#人工智能
迪杰斯特拉(Dijikstra)算法_机器学习

前言:迪杰斯特拉(Dijkstra)算法是典型最短路径算法,用于计算一个节点到其他节点的最短路径。它的主要特点是以起始点为中心向外层层扩展(广度优先搜索思想),直到扩展到终点为止。因为在Isomap 中要用到,这里简单介绍一下. 这里主要结合有相同图结束,无向图是对称矩阵目录1: 算法流程2:算法实现...

强化学习【value iterration】【python]

值迭代(Value Iteration)是解决马尔可夫决策过程(MDP)的经典动态规划算法。其核心基于,通过迭代方式求解最优价值函数。1.2矩阵形式V(s)r(s,a)通过采取行动a目的是找到最优策略使得状态值V最大通过contraction mapping 理论,可知道最优状态值可以通过迭代更新求解。

#算法
【PyTorch][chapter 15][李宏毅深度学习][Neighbor Embedding-LLE]

和传统的PCA,LDA等关注样本方差的降维方法相比,LLE关注于降维时保持样本局部的线性特征,由于LLE在降维时保持了样本的局部特征,它广泛的用于图像图像识别,高维数据可视化等领域。我们得到了高维的权重系数W,那么我们希望这些权重系数对应的线性关系在降维后的低维一样得到保持。要得到最小的d维数据集,我们需要求出矩阵M最小的d个特征值所对应的d个特征向量组成的矩阵。2)算法对最近邻样本数的选择敏感,

文章图片
#深度学习#pytorch
强化学习【Monte Carlo Learning][MC Basic 算法]

状态转移概率往往是未知的,在这种情况下,我们通常会采用蒙特卡洛(Monte Carlo)方法进行求解(该方法本质上是通过大数定律来计算数学期望)。在使用基于模型(model-based)的强化学习方法,特别是进行策略迭代时,我们通常会通过上述公式来求解。在 Policy iteration 的时候计算了 state-action 的均值(大数定律里面的切比雪夫不等式)值迭代(value-itera

#机器学习#人工智能
    共 60 条
  • 1
  • 2
  • 3
  • 6
  • 请选择