
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
强化学习:从入门到进阶
调库能让你完成任务,但只有自己写出 Q-learning、DQN 和 PPO,才会真正知道数据从哪里来、损失怎样计算、终止状态如何处理。如果状态不满足 Markov 性,例如机器人只能看到一个很小的局部视野,那么它面对的是部分可观测 MDP(POMDP)。强化学习真正的门槛不是算法名字,而是理解:长期回报、价值、Bellman 方程、探索、偏差与方差、分布偏移。策略改进定理告诉我们:只要新策略在某
到底了







