logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

强化学习 - 基于策略的Reinforce算法

本文完整推导了REINFORCE策略梯度算法。首先定义了最大化期望回报的目标函数,分析了轨迹的概率分布。通过似然比技巧解决了直接求导的困难,推导出策略梯度表达式。进一步引入折扣回报和baseline技术降低方差,得出优势函数形式。最后总结了三种常见策略梯度表达式,并以高斯策略为例说明了连续动作空间的梯度计算。全文系统性地展示了策略梯度算法的数学推导过程,为理解强化学习中的策略优化提供了理论基础。

#算法#机器学习#人工智能 +1
强化学习 - 基于策略搜索和策略优化: 高斯策略

最近在做毕设需要用强化学习来做控制,对强化学习的知识点做一下总结。高斯策略属于强化学习中的基于策略优化的分支(Policy Optimization),尤其是策略梯度方法(Policy Gradient Methods) 的一部分。这一分支专注于通过优化策略的参数来直接提升策略的性能,而不需要显式地学习一个价值函数。强化学习可以按照以下几个主要分支分类:基于价值函数的方法(Value-Based

#算法#人工智能#自动驾驶
最优化问题 - 内点法

该代码很好地演示了使用对数障碍(log-barrier)的内点法思路:用一系列的无约束子问题(带障碍项)来逼近有约束优化,并在外层迭代中逐渐减小障碍系数 (\mu),使解贴近约束边界的最优解。不过,在正式应用时,往往不会用固定步长的简单梯度下降,而会用牛顿法或线搜索,以获得更好的数值稳定性和收敛速度。代码本身最大的问题是f_3d与注释/公式不匹配,只要改回即可与文档保持一致,也能正确体现“最小化∑

文章图片
#线性代数#算法#矩阵
到底了