
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
大语言模型技术 step by step 第3章 机器学习与深度学习基础
强化学习(RL)研究智能体在与环境交互中通过奖励信号学习最优策略。其框架是马尔可夫决策过程(MDP):智能体在状态sss采取动作aaa,环境返回奖励rrr和新状态s′s's′,智能体学习策略πa∣sπa∣s以最大化累积奖励。虽然预训练主要用自监督学习,但对齐阶段(RLHF,第13章)会用到强化学习:把语言模型视为策略,把人类偏好转化为奖励,用策略梯度方法优化模型。因此,理解强化学习的基本概念对第四

到底了







