logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

CS336 lecture1

本文介绍了三种文本分词方法:1)字符级分词(按字符切分,计算量大);2)词级分词(按完整词语切分,难以处理罕见词);3)子词级分词(主流方法,包括BPE、WordPiece和SentencePiece)。重点分析了子词分词的三种算法:BPE基于频率合并字符对,WordPiece通过概率得分优化合并,SentencePiece则无需预分词直接处理多语言文本。三种方法各有特点,适用于不同场景,其中子词

文章图片
#人工智能#自然语言处理
PPO、DPO和GRPO算法详解

本文对比解析了三种大模型强化学习算法:PPO、DPO和GRPO的核心原理与训练流程。PPO采用四模型架构(Actor、Critic、Reward、Reference),通过近端策略优化实现稳定训练;DPO创新性地绕过奖励建模,直接利用人类偏好数据进行策略优化;GRPO则通过组内对比采样替代价值网络,显著降低计算成本。三者均采用KL散度约束防止模型漂移,但分别代表了奖励建模、直接优化和对比学习三种技

BERT 学习笔记

BERT是Google提出的基于Transformer的双向预训练语言模型。其核心架构包含嵌入层(词嵌入、句段嵌入、位置嵌入)、Transformer编码器(多头注意力机制)和任务适配层。预训练采用掩码语言模型(MLM)和下一句预测(NSP)两个任务:MLM随机遮蔽15%的token进行预测,NSP判断句子关系。模型通过12层编码器将输入转换为768维向量,下游任务可微调输出层处理分类、问答等任务

文章图片
#bert
到底了