[人工智能]强化学习(RL)算法:概念、方法与工程实践
强化学习(RL)算法:概念、方法与工程实践
本文从工程视角系统介绍强化学习(Reinforcement Learning, RL)算法,包括问题建模、主要算法家族、探索策略、函数逼近以及工程实践要点。目标是帮助读者理解在什么场景下适合采用RL、如何在工程系统中落地典型算法,而不是进行严格的数学证明。

图1:示意性的训练曲线,展示回合回报随训练回合数的提升趋势(示意)。

图2:价值函数迭代更新过程中Bellman误差逐步收敛的示意曲线(示意)。

图3:ε-greedy策略中探索概率ε与利用程度的权衡关系示意。
|
算法家族 |
代表算法 |
核心思想 |
典型应用场景 |
|
基于价值 |
表格型Q-learning、SARSA、DQN |
学习状态(-动作)价值函数,再从中导出贪心策略。 |
离散动作控制、博弈、简单机器人控制等。 |
|
基于策略 |
REINFORCE、PPO、TRPO |
直接参数化并优化策略,使用梯度方法最大化期望回报。 |
连续动作控制、需要随机策略的高维动作空间。 |
|
Actor-Critic |
A2C/A3C、DDPG、TD3、SAC |
同时学习价值估计(Critic)和参数化策略(Actor)。 |
样本效率较高的控制任务、连续动作空间。 |
|
基于模型 |
Dyna-Q、MCTS、PETS等 |
先学习环境动态模型,再通过规划或虚拟Rollout进行决策。 |
规划问题、对数据效率要求较高的机器人场景。 |
表1:强化学习主要算法家族、核心思想及典型应用场景。
|
算法 |
类型 |
On/Off-policy |
归属类别 |
关键特征 |
|
Q-learning |
表格型 |
Off-policy |
基于价值 |
通过对下一状态动作价值的最大值进行Bootstrapping,结构简单但对大规模问题不稳定。 |
|
SARSA |
表格型 |
On-policy |
基于价值 |
按照实际执行的动作更新价值,行为更“保守”,风险相对较低。 |
|
DQN |
深度 |
Off-policy |
基于价值 |
使用神经网络逼近价值函数,并结合经验回放与目标网络提升稳定性。 |
|
REINFORCE |
深度 |
On-policy |
基于策略 |
蒙特卡洛策略梯度,原理简单但梯度方差较大。 |
|
PPO |
深度 |
On-policy |
基于策略 |
通过剪切(clipping)目标函数提升训练稳定性和易调参性。 |
|
DDPG |
深度 |
Off-policy |
Actor-Critic |
用于连续动作的确定性策略梯度算法,结合经验回放与目标网络。 |
表2:代表性强化学习算法及其类型、On/Off-policy属性与关键特征。
|
术语 |
符号 |
含义 |
说明 |
|
状态 |
s |
智能体在某一时刻对环境的观测或表征。 |
可以是原始观测,也可以是经过特征提取后的表示。 |
|
动作 |
a |
智能体在给定状态下做出的决策。 |
可以是离散动作(如左/右)、也可以是连续动作(如转矩)。 |
|
回报/奖励 |
r |
立即反馈当前状态-动作好坏的标量信号。 |
奖励函数设计对最终策略行为影响极大。 |
|
策略 |
π(a|s) |
给定状态时输出动作分布的映射。 |
可用参数向量或神经网络进行表达。 |
|
回报 |
G_t |
从时刻t起未来折扣奖励之和。 |
G_t = Σ_k γ^k r_{t+k+1}。 |
表3:强化学习中的核心术语及常用符号说明。
1. 强化学习问题建模
强化学习将序贯决策问题形式化为智能体与环境之间的交互:在每个时间步t,智能体观测到状态s_t,选择动作a_t,收到奖励r_{t+1}并转移到新状态s_{t+1}。目标是寻找一条策略,使得从长远来看累计折扣奖励(回报)最大。
绝大多数RL算法基于马尔可夫决策过程(MDP)假设,即下一状态和奖励只依赖于当前状态和动作。实际工程系统往往存在部分可观测、时延和噪声等问题,因此需要通过状态聚合、特征工程或使用RNN等方式近似满足MDP假设。
2. 基于价值的方法
基于价值的方法通过学习价值函数来评价“在某状态或执行某动作的好坏”,典型算法包括表格型Q-learning和SARSA。这类算法采用时序差分(TD)更新,对概念理解与教学非常友好,但难以扩展到大规模连续状态空间。
深度Q网络(DQN)使用神经网络逼近Q函数,并引入经验回放与目标网络来缓解训练不稳定问题。在Atari等基准任务中,DQN及其改进算法(如Double DQN、Dueling DQN、分布式RL等)取得了代表性成果。
3. 策略梯度与Actor-Critic方法
策略梯度方法直接对参数化策略进行优化,通过最大化期望回报的梯度来更新策略参数。REINFORCE算法是最基础的蒙特卡洛策略梯度方法,利用对数似然技巧推导梯度表达,形式简洁,但存在方差较大、收敛慢等问题。
Actor-Critic方法在此基础上增加了一个Critic网络,用于估计价值函数或优势函数,从而降低梯度估计的方差并提升样本效率。A2C/A3C、DDPG、TD3、SAC等算法在连续控制领域得到广泛应用,常结合熵正则、双Critic等技巧稳定训练。
4. 基于模型的强化学习与规划
基于模型的RL显式学习环境动态模型,并据此进行规划或生成虚拟经验。典型方法包括Dyna-Q(将真实经验与模型Rollout混合更新)、以及在搜索中使用环境模拟的蒙特卡罗树搜索(MCTS)等。
在连续高维场景中,精确建模环境较为困难,但通过不确定性建模和模型集成,即使不完美的模型也能辅助提高数据效率。对于机器人和工业控制等真实采样代价较高的场景,基于模型的方法具有明显优势。
5. 探索策略
在RL中,如何在探索(尝试新动作)和利用(选择已知较优动作)之间取得平衡是核心问题之一。最常见的策略是ε-greedy和softmax选择,前者以概率ε随机选择动作,以1-ε选择当前估计最优动作。
对于奖励稀疏或存在局部最优的环境,简单的随机探索往往效果有限。更高级的探索方法包括基于置信上界(UCB)、基于访问次数的探索奖励、好奇心驱动的内在奖励以及参数噪声等,这些方法鼓励智能体主动访问不确定或未充分探索的状态。
6. 函数逼近与稳定性
在使用神经网络逼近价值函数或策略时,稳定性是工程实践中的首要问题。Bootstrapping、Off-policy学习和函数逼近三者叠加容易导致训练发散或剧烈震荡,需要在学习率、目标网络更新频率、经验回放缓冲区大小以及输入与奖励归一化方面进行精心设计。
正则化、梯度裁剪、输入归一化等技术可以显著提高训练稳定性。对于RNN结构或强Off-policy场景,批归一化、层归一化的使用也需谨慎,以避免引入额外的分布偏移。
7. 工程实践建议
在真实工程项目中,成功的RL系统往往依赖完备的实验基础设施:包括随机种子管理、日志记录、模型检查点、评估协议等。自动化的超参数搜索往往比手工调参更容易找到表现良好的配置。
奖励设计、观测归一化和动作缩放是提高训练效率的关键工程手段。在安全要求较高的场景下,通常先在仿真环境中验证策略,再采用渐进式上线策略,以降低新策略造成严重故障的风险。
8. 应用与局限
强化学习在游戏(棋类、Atari、StarCraft)、机器人控制、推荐系统和运筹优化等领域取得了显著成果。这些成功案例通常需要精心设计的环境、大规模计算资源以及跨学科的领域知识。
与此同时,RL算法仍然存在易受参数影响、数据需求量大和对奖励函数敏感等问题。在实际工程中,应首先判断问题是否真正需要在线试错学习,并与监督学习、规则策略等更简单的方案进行权衡。
更多推荐

所有评论(0)