
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文系统介绍了强化学习的基础概念。强化学习是智能体与环境多轮交互的序贯决策过程,其核心目标是最大化累积奖励期望。与有监督学习相比,强化学习的数据分布会随策略更新而动态变化,且需要同时考虑即时奖励和长期收益。文章详细阐述了强化学习三要素(感知、决策、奖励)、环境建模方法以及价值函数定义,并对比分析了强化学习与有监督学习在优化目标和数据特性上的本质区别。
模型在RL中的概念以及基于环境模型的分类【(model-based reinforcement learning)和无模型的强化学习根据智能体与环境交互采样到的数据直接进行策略提升或者价值估计,Sarsa 和 Q-learning 算法,便是两种无模型的强化学习方法,本书在后续章节中将要介绍的方法也大多是无模型的强化学习算法。本章即将介绍的 Dyna-Q 算法也是非常基础的基于模型的强化学习算法,
模型在RL中的概念以及基于环境模型的分类【(model-based reinforcement learning)和无模型的强化学习根据智能体与环境交互采样到的数据直接进行策略提升或者价值估计,Sarsa 和 Q-learning 算法,便是两种无模型的强化学习方法,本书在后续章节中将要介绍的方法也大多是无模型的强化学习算法。本章即将介绍的 Dyna-Q 算法也是非常基础的基于模型的强化学习算法,
第 4 章介绍的动态规划算法要求马尔可夫决策过程是已知的,即要求与智能体交互的环境是完全已知的(例如迷宫或者给定规则的网格世界)。在此条件下,智能体其实并不需要和环境真正交互来采样数据,直接用动态规划算法就可以解出最优价值或策略。这就好比对于有监督学习任务,如果直接显式给出了数据的分布公式,那么也可以通过在期望层面上直接最小化模型的泛化误差来更新模型参数,并不需要采样任何数据点。机器学习的主要方法







