【大模型概述】
一.大模型LLM是干什么的
大模型就是一个通过海量数据学习,能理解、生成人类语言,并完成各种智能任务的通用人工智能。
-
理解人类语言能读懂文字、理解意图、提取信息、做总结、做翻译。
-
生成人类语言写文案、写代码、写邮件、写报告、对话聊天、创作内容。
-
执行复杂任务逻辑推理、数学计算、代码编写、规划步骤、决策建议。
-
作为通用基座可以通过微调、外挂工具,适配各行各业:客服、教育、医疗、法律、办公自动化、智能助手等。
二.为什么会出现大模型
大模型的出现,是数据、算力、模型架构三者共同推动的必然结果:
- 数据层面:互联网积累了海量多样化文本,为模型提供了充足学习素材;
- 算力层面:GPU 与分布式训练技术成熟,使大规模模型训练成为可能;
- 模型架构层面:Transformer 提出与 Scaling Law 发现,证明 “越大越强”,推动了参数规模爆炸式增长。
三.大模型计量单位?
训练数据:Ttoken,10^12
算力:FlOPS:单位时间浮点数运算次数
参数:B:10亿
四.大模型分类:
生成式:文本模型(LLM),多模态模型
嵌入模型:embeding
重排序:reranker
分类器/判别器模型
五.AIGC和AGI
AIGC:用AI生成内容(工具)
AGI:通用人工智能
六.大语言模型演进路线
RNN->LSTM->GRU->seq2seq->seq2seq+attention->transformer
transformer:编码器+解码器,
为什么现在大模型用的都是decoder-only?
因为decoder-only是自回归生成,更符合人类语言规范
效率更好
七.什么是预训练:
在一个巨大的通用语料库(互联网文本、书籍、代码、论文等)上,让模型进行无监督学习,学习语言规律、世界知识、逻辑推理。
对应大模型:
预训练后的模型 = 懂数学、懂物理、懂代码、懂人类语言
但它还不会按照你的指令做事
八.什么是监督微调(SFT):
先用大量高质量的「问题 + 标准答案」数据,去训练一个已经预训练好的大模型,让模型学会按照人类期望的方式回答,而不是随便瞎编。
然后让模型照着学、照着说。学完之后,它就变成听话、好用、能落地的对话模型。
输入:指令 / 问题(prompt)
输出:标准答案(response)
九.什么是人类反馈强化学习(RLHF):
RLHF = 让 AI 不仅会做题,还要学会 “人话”、讲礼貌、不胡说、更安全。(让模型学会人类喜欢什么样的回答 → 更有用、更安全、更自然、不乱编、不骂人)
RLHF 三步流程(必考)
① 收集人类反馈
给模型同一个问题,生成多个回答,让人来:
打分(1~5 分)
排序(哪个好、哪个差)
标注是否安全、合规
② 训练奖励模型(Reward Model, RM)
让 AI 学人类的口味:“人类觉得哪种回答更好。”
③ 用强化学习(PPO)微调大模型
让模型朝着 “得分更高” 的方向进化:
说得更清楚
更有用
更安全
不乱编
不冒犯
十.什么是强化学习:
强化学习 = 让 AI 在不断试错中学习,靠 “奖励” 和 “惩罚” 变得越来越聪明。
强化学习三大特点
1.没有标准答案不像监督学习有 “正确答案”,只有奖励信号。
2.试错学习错多了就知道什么不能做,对多了就知道最优路线。
3.长期收益优先不只看眼前一步,还要看未来能不能拿更高分。
十一.大语言模型训练范式?
预训练+后训练
后训练:监督微调(SFT)+人类反馈强化学习(RLHF)
预训练目标:让模型学习语义知识
后训练目标:做指令微调,限制输出内容
十二.大模型的算力基础设施?
显卡:A100,H100,B100,V100
显存:GPU的内存
训练阶段硬件瓶颈?
显存,多卡通信,单卡算力
推理阶段硬件瓶颈?
显存,显存带宽,多卡通信,单卡算力
更多推荐


所有评论(0)