happy-llm项目task06:大模型与传统预训练模型的区别以及大模型训练流程三段论
前情回顾
transformer架构的出现使得自然语言处理NLP领域处理数据变得高效,随后基于transformer架构的BERT、GPT等这些预训练模型使得NLP领域进入预训练-微调的范式。
Transformer架构主要包括两大部分,编码器Encoder和解码器Decoder。 预训练语言模型PLM主要有三大类,Encoder-only 类的BERT, Encoder-Decoder类的T5, Decoder-Only类的GPT、LLaMA和GLM(智谱开发的中文LLM)。
相对于预训练模型,什么是大语言模型
狭义来说,大语言模型是指,GPT-3(1750亿参数)是LLM的开端,基于GPT-3通过预训练(Pretraining)、监督微调(Supervised Fine-Tuning,SFT)、强化学习与人类反馈(Reinforcement Learning with Human Feedback, RLHF)三阶段训练得到的ChatGPT
广义来说
大语言模型的能力
涌现能力 Emergent Abilities
这是区分LLM与传统PLM最显著的特征,指的是同样的模型架构与预训练任务下,某些能力在小型模型中不明显,但在大模型中特别突出。可以定义为与某些复杂任务相关的能力
上下文学习 In-context Learning
由GPT-3首次引入。指的是,通过理解上下文并生成相应输出的方式来执行任务,而无需额外的训练或参数更新。
通过上下文学习能力的LLM, 开始向Prompt Engineering 来激发LLM的能力转变
指令遵循 Instruction Following
即,在指令微调阶段,混合多种指令,来训练其泛化能力
逐步推理 Step by Step Reasoning
能够处理复杂逻辑任务
训练LLM一:预训练Pretrain
这是训练LLM最核心也是工程量最大的一步。这是LLM强大能力的根本来源。
目前,主流LLM几乎都采用了Decoder-Only的类GPT架构(LLaMA架构),它们预训练任务是因果语言模型(Causal Language Model, CLM)。
因果语言模型建模,通过给出上文,要求模型预测下一个token来进行训练。
LLM同传统PLM模型的核心差异在于,一是预训练的参数量,而是算力资源的消耗。因此分布式训练框架也成为LLM训练的必不可少的组成部分。
训练LLM二:有监督微调SFT
预训练赋予了LLM能力,但是还需要SFT激发出来。
不再是像因果模型一样,指定上文,预测下文。而是,去训练模型的泛化能力,这是通过让模型得到不同类型不同风格的指令来做到的。
SFT的数据质量和数据配比,决定了模型指令遵循能力的重要因素。
训练LLM三:人类反馈强化学习RLHF
全称是 Reinforcement Learning from Human Feedback,。
这是ChatGPT相对于GPT-3的最核心突破。
从功能上看,将LLM的训练过程可以分为预训练和对齐Alignment。前者的核心作用是,赋予模型海量的知识,后者的作用是,让模型与人类的价值观一致。
ChatGPT的技术报告中,将对齐分为三个阶段,第一个是有监督微调,后两个是训练RM和PPO训练,就是RLHF。RM,Reward Model,即奖励模型,PPO,Proximal Policy Optimization,近端策略优化算法。
RLHF的思路
引入强化学习的技术,通过实时的人类反馈,令LLM给出更令人满意的回复。
使用 PPO 算法的强化学习训练过程
待补充
更多推荐
所有评论(0)