logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

强化学习:从入门到进阶

调库能让你完成任务,但只有自己写出 Q-learning、DQN 和 PPO,才会真正知道数据从哪里来、损失怎样计算、终止状态如何处理。如果状态不满足 Markov 性,例如机器人只能看到一个很小的局部视野,那么它面对的是部分可观测 MDP(POMDP)。强化学习真正的门槛不是算法名字,而是理解:长期回报、价值、Bellman 方程、探索、偏差与方差、分布偏移。策略改进定理告诉我们:只要新策略在某

#学习#人工智能
到底了