
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
强化学习笔记(一)马尔可夫决策过程参考资料正文Q1: RtR_{t}Rt, GtG_{t}Gt, V(St)V(S_{t})V(St)都有奖励或收获的含义,它们有什么区别?Q2:为什么GtG_{t}Gt使用那样的衰减公式?Q3:贝尔曼方程的作用?Q4:π(a∣s)\pi(a|s)π(a∣s)和Pss′aP_{ss'}^{a}Pss′a的区别?Q5: Vπ(s)V_\pi(s)Vπ(s)
强化学习笔记(二)动态规划法求解MDPQ1:策略迭代和价值迭代的区别在哪?附:GridWorld游戏的MATLAB代码在MDP的内容中已经证明了一定存在best policy,并且递推公式是最终收敛到best policy的。那么动态规划是一个比较直观求解MDP的方法。我对于Dynamic Programming不是很了解,也没有刷过Leetcode的题目。很多文章在讲解的时候提到了“分治”,“递
强化学习笔记(二)动态规划法求解MDPQ1:策略迭代和价值迭代的区别在哪?附:GridWorld游戏的MATLAB代码在MDP的内容中已经证明了一定存在best policy,并且递推公式是最终收敛到best policy的。那么动态规划是一个比较直观求解MDP的方法。我对于Dynamic Programming不是很了解,也没有刷过Leetcode的题目。很多文章在讲解的时候提到了“分治”,“递
首先激活自己想要导出的Conda环境(假设环境名是my_environment)conda activate my_enviroment导出至environment.yaml文件中conda env export > environment.yaml在另一台电脑上复现conda环境conda env create -f environment.yaml前面只是导出了conda install







