
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
CS336 lecture1
本文介绍了三种文本分词方法:1)字符级分词(按字符切分,计算量大);2)词级分词(按完整词语切分,难以处理罕见词);3)子词级分词(主流方法,包括BPE、WordPiece和SentencePiece)。重点分析了子词分词的三种算法:BPE基于频率合并字符对,WordPiece通过概率得分优化合并,SentencePiece则无需预分词直接处理多语言文本。三种方法各有特点,适用于不同场景,其中子词

PPO、DPO和GRPO算法详解
本文对比解析了三种大模型强化学习算法:PPO、DPO和GRPO的核心原理与训练流程。PPO采用四模型架构(Actor、Critic、Reward、Reference),通过近端策略优化实现稳定训练;DPO创新性地绕过奖励建模,直接利用人类偏好数据进行策略优化;GRPO则通过组内对比采样替代价值网络,显著降低计算成本。三者均采用KL散度约束防止模型漂移,但分别代表了奖励建模、直接优化和对比学习三种技
到底了








