logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

小白也能看懂的大模型训练:预训练、微调、RLHF到底在干嘛

│ 大模型训练三阶段全景图 ││ ││ 第一阶段:预训练(Pre-training) ││ ├─ 目标:学会预测下一个词(完形填空) ││ ├─ 数据:万亿级Token(网页、书籍、代码) ││ ├─ 成本:数千万美元,数千GPU ││ └─ 产出:基座模型(能续写,但不会好好对话) ││ │ ││ ▼ ││ 第二阶段:监督微调(SFT) ││ ├─ 目标:学会按要求回答问题(问答培训) ││ ├

小白也能看懂的Tokenizer:大模型是怎么“读“文字的

Tokenizer是大模型的"文字入口",它决定了模型看到的不是一个一个的字或词,而是一串数字ID。大模型不直接读文字,必须通过Tokenizer将文本转换为token ID序列子词切分是现代Tokenizer的主流方案,在词表大小和表达能力之间取得平衡BPE是最经典的子词算法,核心就是不断合并高频相邻字符对WordPiece和SentencePiece是BPE的变体,核心思路类似但策略和适用范围

#自然语言处理
小白也能看懂的大模型推理优化:为什么AI回复能这么快

Prefill + Decode 两阶段:像考试一样,先审题(并行处理),再写答案(逐字生成)。KV Cache:像草稿纸一样缓存中间结果,避免重复计算,是加速的基石。模型量化:像图片压缩一样缩小模型体积,INT4 量化让大模型在消费级显卡上也能跑。:减少"搬运数据"的次数,让注意力计算快好几倍。投机解码:小助理写草稿、老板审核,用并行换速度,质量不打折。批处理:让多个用户共享 GPU,Conti

#人工智能#AIGC
小白也能看懂的MoE架构:Mixtral、DeepSeek背后的混合专家

Prefill + Decode 两阶段:像考试一样,先审题(并行处理),再写答案(逐字生成)。KV Cache:像草稿纸一样缓存中间结果,避免重复计算,是加速的基石。模型量化:像图片压缩一样缩小模型体积,INT4 量化让大模型在消费级显卡上也能跑。:减少"搬运数据"的次数,让注意力计算快好几倍。投机解码:小助理写草稿、老板审核,用并行换速度,质量不打折。批处理:让多个用户共享 GPU,Conti

#深度学习
小白也能看懂的位置编码:大模型怎么知道字的顺序

位置编码虽然是Transformer中的"小模块",但解决的是模型理解序列的根本性问题。Sinusoidal用数学函数给每个位置生成"指纹",优雅但表达力有限;可学习编码让模型自己学位置,灵活但受限于训练长度;RoPE通过旋转设计让位置信息天然融入注意力计算,成为当前最优解;长文本扩展(NTK Scaling、YaRN等)解决了RoPE的外推短板。对开发者来说,RoPE是当前大模型位置编码的基础方

小白也能看懂的LoRA微调:一张显卡也能玩转大模型

预训练模型 + 你的数据 = 你的专属模型大模型在训练时已经"读"了海量互联网文本,具备很强的通用能力。但如果你想让它做特定领域的事情——比如当客服机器人、写医疗报告、生成法律合同——通用模型就不太够用了。微调就是拿一个已经训练好的模型,再用你自己准备的数据继续训练它,让它学会你的"行话"和"规矩"。就好比一个什么都会的实习生,你给他一些业务文档和案例培训几天,他就能上手干活了。LoRA已经成为微

#机器学习
小白也能看懂的预训练:大模型是怎么“读遍互联网“的

互联网原始数据(万亿Token级别)↓数据预处理(去重、过滤、去毒、配比)↓模型训练(数千张GPU × 数周,做Next Token Prediction)↓基座模型(Base Model)——知识丰富,但只会续写,不会对话↓后续训练(SFT + RLHF)→ 对话助手(如ChatGPT)预训练的本质,就是用"猜下一个词"这个看似简单的任务,逼迫模型从海量文本中习得人类语言的规律和世界知识。它是大

小白也能看懂的SFT微调:让大模型从“续写机器“变成“贴心助手“

来回顾一下今天的核心知识点:要点内容SFT解决什么问题让预训练模型从"文字续写"变成"指令回答"核心思路用带标准答案的指令数据做有监督微调训练关键只在output部分计算loss,不关注instruction部分数据策略质量远重于数量,1000条精选数据 > 10万条粗糙数据SFT的局限只教了模型"回答",没教它"回答得好"——需要RLHF预训练(学知识)→ SFT(学回答)→ RLHF(学好回答

#人工智能#机器学习
小白也能看懂的DPO:比RLHF简单得多的对齐方案

RLHF 虽然有效,但流程复杂、训练不稳定、资源消耗大。DPO 通过数学变换,将奖励模型"内化"到策略模型中,跳过了显式的奖励模型训练。DPO 的数据格式和 RLHF 一样使用偏好对数据,迁移成本极低。DPO 的训练更简单、更稳定、显存占用更少,效果与 RLHF 接近。DPO 的变体(IPO、KTO、ORPO)在不同场景下各有优势。目前,DPO 已经成为大模型对齐领域的主流方案之一。越来越多的开源

#人工智能#深度学习
小白也能看懂的大模型推理基础:KV Cache 让生成速度飞起来

训练 vs 推理:训练计算密集、推理显存密集,优化逻辑完全不同;推理双阶段:Prefill 并行处理输入(计算瓶颈),Decode 逐字生成(显存带宽瓶颈);KV Cache 核心价值:缓存历史 K、V 向量,消除平方级重复计算,复杂度 O (N²)→O (N),推理必备;KV Cache 痛点:长序列、多并发大量占用显存,70B 模型 4k 序列缓存可达 12.8GB;缓存优化方案:GQA 是当

    共 32 条
  • 1
  • 2
  • 3
  • 4
  • 请选择