
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
《强化学习》-读书笔记-第三章 有限马尔科夫决策过程
三. 有限马尔科夫决策过程(有限MDP)目标和收益回报和分幕策略和价值函数最优策略与最优价值函数三. 有限马尔科夫决策过程(有限MDP)在有限MDP中,状态、动作和收益的集合(SSS、AAA和RRR)都只有有限个元素。p(s′,r∣s,a)=Pr{St=s′,Rt=r∣St−1=s,At−1=a}p(s',r|s,a)=Pr\{S_t=s',R_t=r|S_{t-1}=s,A_{t-1}=a\}p
到底了







