
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
Python强化学习实例,基于上一篇自主寻优,QLearning算法实现序贯决策,迷宫代码
序贯决策是时间序列中,多个阶段需要连续决策,决策是分前后顺序的,前一步的选择直接影响后一步的选择,就像走迷宫一样,走错一步,可能后续就到了死胡同。上一篇笔记已经了解了一些基本概念。这一篇举一个实例。QLearning算法是一种强化学习中的异策略算法。所谓异就是action的策略使用贪婪策略,即选择的结果就是值最大的action,或者说最优的action。而状态行为(state_action)的策略
到底了








