
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
RLHF中的PPO算法过程微观拆解
强化学习中的PPO算法微观拆解。在强化学习中,Rollout是指在给定的策略下模拟环境的过程。在PPO中,Rollout的过程对应于根据当前的语言模型(策略)生成文本(轨迹)。这个过程依赖于在prompt库中抽取的一个batch的数据Batch Prompt和当前的语言模型LM。语言模型接收一个prompt作为输入,并生成一个Response。这些Response就构成了我们的"轨迹"。Evalu

【数学基础知识】证明三角形的中线交于一点
三角形的三条中线交于一点。本文用初中知识证明了该定理。

到底了








