强化学习(RL)算法:概念、方法与工程实践

本文从工程视角系统介绍强化学习(Reinforcement Learning, RL)算法,包括问题建模、主要算法家族、探索策略、函数逼近以及工程实践要点。目标是帮助读者理解在什么场景下适合采用RL、如何在工程系统中落地典型算法,而不是进行严格的数学证明。

1:示意性的训练曲线,展示回合回报随训练回合数的提升趋势(示意)。

2:价值函数迭代更新过程中Bellman误差逐步收敛的示意曲线(示意)。

3ε-greedy策略中探索概率ε与利用程度的权衡关系示意。

算法家族

代表算法

核心思想

典型应用场景

基于价值

表格型Q-learning、SARSA、DQN

学习状态(-动作)价值函数,再从中导出贪心策略。

离散动作控制、博弈、简单机器人控制等。

基于策略

REINFORCE、PPO、TRPO

直接参数化并优化策略,使用梯度方法最大化期望回报。

连续动作控制、需要随机策略的高维动作空间。

Actor-Critic

A2C/A3C、DDPG、TD3、SAC

同时学习价值估计(Critic)和参数化策略(Actor)。

样本效率较高的控制任务、连续动作空间。

基于模型

Dyna-Q、MCTS、PETS等

先学习环境动态模型,再通过规划或虚拟Rollout进行决策。

规划问题、对数据效率要求较高的机器人场景。

表1:强化学习主要算法家族、核心思想及典型应用场景。

算法

类型

On/Off-policy

归属类别

关键特征

Q-learning

表格型

Off-policy

基于价值

通过对下一状态动作价值的最大值进行Bootstrapping,结构简单但对大规模问题不稳定。

SARSA

表格型

On-policy

基于价值

按照实际执行的动作更新价值,行为更“保守”,风险相对较低。

DQN

深度

Off-policy

基于价值

使用神经网络逼近价值函数,并结合经验回放与目标网络提升稳定性。

REINFORCE

深度

On-policy

基于策略

蒙特卡洛策略梯度,原理简单但梯度方差较大。

PPO

深度

On-policy

基于策略

通过剪切(clipping)目标函数提升训练稳定性和易调参性。

DDPG

深度

Off-policy

Actor-Critic

用于连续动作的确定性策略梯度算法,结合经验回放与目标网络。

表2:代表性强化学习算法及其类型、On/Off-policy属性与关键特征。

术语

符号

含义

说明

状态

s

智能体在某一时刻对环境的观测或表征。

可以是原始观测,也可以是经过特征提取后的表示。

动作

a

智能体在给定状态下做出的决策。

可以是离散动作(如左/右)、也可以是连续动作(如转矩)。

回报/奖励

r

立即反馈当前状态-动作好坏的标量信号。

奖励函数设计对最终策略行为影响极大。

策略

π(a|s)

给定状态时输出动作分布的映射。

可用参数向量或神经网络进行表达。

回报

G_t

从时刻t起未来折扣奖励之和。

G_t = Σ_k γ^k r_{t+k+1}。

表3:强化学习中的核心术语及常用符号说明。

1. 强化学习问题建模

强化学习将序贯决策问题形式化为智能体与环境之间的交互:在每个时间步t,智能体观测到状态s_t,选择动作a_t,收到奖励r_{t+1}并转移到新状态s_{t+1}。目标是寻找一条策略,使得从长远来看累计折扣奖励(回报)最大。

绝大多数RL算法基于马尔可夫决策过程(MDP)假设,即下一状态和奖励只依赖于当前状态和动作。实际工程系统往往存在部分可观测、时延和噪声等问题,因此需要通过状态聚合、特征工程或使用RNN等方式近似满足MDP假设。

2. 基于价值的方法

基于价值的方法通过学习价值函数来评价“在某状态或执行某动作的好坏”,典型算法包括表格型Q-learning和SARSA。这类算法采用时序差分(TD)更新,对概念理解与教学非常友好,但难以扩展到大规模连续状态空间。

深度Q网络(DQN)使用神经网络逼近Q函数,并引入经验回放与目标网络来缓解训练不稳定问题。在Atari等基准任务中,DQN及其改进算法(如Double DQN、Dueling DQN、分布式RL等)取得了代表性成果。

3. 策略梯度与Actor-Critic方法

策略梯度方法直接对参数化策略进行优化,通过最大化期望回报的梯度来更新策略参数。REINFORCE算法是最基础的蒙特卡洛策略梯度方法,利用对数似然技巧推导梯度表达,形式简洁,但存在方差较大、收敛慢等问题。

Actor-Critic方法在此基础上增加了一个Critic网络,用于估计价值函数或优势函数,从而降低梯度估计的方差并提升样本效率。A2C/A3C、DDPG、TD3、SAC等算法在连续控制领域得到广泛应用,常结合熵正则、双Critic等技巧稳定训练。

4. 基于模型的强化学习与规划

基于模型的RL显式学习环境动态模型,并据此进行规划或生成虚拟经验。典型方法包括Dyna-Q(将真实经验与模型Rollout混合更新)、以及在搜索中使用环境模拟的蒙特卡罗树搜索(MCTS)等。

在连续高维场景中,精确建模环境较为困难,但通过不确定性建模和模型集成,即使不完美的模型也能辅助提高数据效率。对于机器人和工业控制等真实采样代价较高的场景,基于模型的方法具有明显优势。

5. 探索策略

在RL中,如何在探索(尝试新动作)和利用(选择已知较优动作)之间取得平衡是核心问题之一。最常见的策略是ε-greedy和softmax选择,前者以概率ε随机选择动作,以1-ε选择当前估计最优动作。

对于奖励稀疏或存在局部最优的环境,简单的随机探索往往效果有限。更高级的探索方法包括基于置信上界(UCB)、基于访问次数的探索奖励、好奇心驱动的内在奖励以及参数噪声等,这些方法鼓励智能体主动访问不确定或未充分探索的状态。

6. 函数逼近与稳定性

在使用神经网络逼近价值函数或策略时,稳定性是工程实践中的首要问题。Bootstrapping、Off-policy学习和函数逼近三者叠加容易导致训练发散或剧烈震荡,需要在学习率、目标网络更新频率、经验回放缓冲区大小以及输入与奖励归一化方面进行精心设计。

正则化、梯度裁剪、输入归一化等技术可以显著提高训练稳定性。对于RNN结构或强Off-policy场景,批归一化、层归一化的使用也需谨慎,以避免引入额外的分布偏移。

7. 工程实践建议

在真实工程项目中,成功的RL系统往往依赖完备的实验基础设施:包括随机种子管理、日志记录、模型检查点、评估协议等。自动化的超参数搜索往往比手工调参更容易找到表现良好的配置。

奖励设计、观测归一化和动作缩放是提高训练效率的关键工程手段。在安全要求较高的场景下,通常先在仿真环境中验证策略,再采用渐进式上线策略,以降低新策略造成严重故障的风险。

8. 应用与局限

强化学习在游戏(棋类、Atari、StarCraft)、机器人控制、推荐系统和运筹优化等领域取得了显著成果。这些成功案例通常需要精心设计的环境、大规模计算资源以及跨学科的领域知识。

与此同时,RL算法仍然存在易受参数影响、数据需求量大和对奖励函数敏感等问题。在实际工程中,应首先判断问题是否真正需要在线试错学习,并与监督学习、规则策略等更简单的方案进行权衡。

更多推荐