logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

强化学习笔记(一)马尔可夫决策过程

强化学习笔记(一)马尔可夫决策过程参考资料正文Q1: RtR_{t}Rt​, GtG_{t}Gt​, V(St)V(S_{t})V(St​)都有奖励或收获的含义,它们有什么区别?Q2:为什么GtG_{t}Gt​使用那样的衰减公式?Q3:贝尔曼方程的作用?Q4:π(a∣s)\pi(a|s)π(a∣s)和Pss′aP_{ss'}^{a}Pss′a​的区别?Q5: Vπ(s)V_\pi(s)Vπ​(s)

#人工智能#机器学习#算法
强化学习笔记(二)动态规划法求解MDP

强化学习笔记(二)动态规划法求解MDPQ1:策略迭代和价值迭代的区别在哪?附:GridWorld游戏的MATLAB代码在MDP的内容中已经证明了一定存在best policy,并且递推公式是最终收敛到best policy的。那么动态规划是一个比较直观求解MDP的方法。我对于Dynamic Programming不是很了解,也没有刷过Leetcode的题目。很多文章在讲解的时候提到了“分治”,“递

#算法#机器学习
强化学习笔记(二)动态规划法求解MDP

强化学习笔记(二)动态规划法求解MDPQ1:策略迭代和价值迭代的区别在哪?附:GridWorld游戏的MATLAB代码在MDP的内容中已经证明了一定存在best policy,并且递推公式是最终收敛到best policy的。那么动态规划是一个比较直观求解MDP的方法。我对于Dynamic Programming不是很了解,也没有刷过Leetcode的题目。很多文章在讲解的时候提到了“分治”,“递

#算法#机器学习
Anaconda环境的移植方法

首先激活自己想要导出的Conda环境(假设环境名是my_environment)conda activate my_enviroment导出至environment.yaml文件中conda env export > environment.yaml在另一台电脑上复现conda环境conda env create -f environment.yaml前面只是导出了conda install

#pip
到底了