大模型核心知识精要
·
大模型核心知识精要
一、大模型是什么
- 参数规模:通常 ≥ 10 亿,顶尖达万亿级
- 训练数据:自监督学习,使用海量未标注文本(如 Qwen3 用 36T token)
- 能力:跨任务泛化,单一模型可完成多种任务
三大促成因素:数据够多 + 算力够强 + Transformer 架构可扩展
计量单位:
- 参数规模:B(Billion,10⁹)
- 数据集:T token(10¹² token)
- 计算量:E FLOPs(10¹⁸ FLOPs)
- 算力:P FLOPS(10¹⁵ FLOPS/秒)
二、模型分类
| 类型 | 输入 | 输出 | 代表 |
|---|---|---|---|
| 生成式 | 上下文 | 文本/图像/音频 | GPT, Qwen, DeepSeek, DALL·E |
| 嵌入模型 | 文本/多模态 | 固定维度向量 | BGE, Qwen-Embedding |
| 重排序模型 | (query, doc) | 相关性分数 | BGE-Reranker |
| 判别模型 | 各种模态 | 标签/概率 | BERT 微调小模型 |
按模态分(生成模型):
- LLM:文本→文本(Qwen3, DeepSeek-V3)
- 多模态理解:文本+图像/音视频→文本(Qwen-VL)
- 多模态生成:文生图/视频/音频(Stable Diffusion, Sora)
三、AIGC vs AGI
- AIGC:用 AI 生成内容(已实现)
- AGI:通用人工智能,能自主学习并解决大多数人类问题(尚未实现)
四、开源生态
- 大模型“开源”主要指开源权重,可能含推理代码,通常不含训练代码和数据集
- 开源代表:DeepSeek, Qwen, Llama
- 闭源代表:GPT(早期除外), Gemini, Claude
五、架构演进与选型
演进路径
RNN → LSTM → GRU → Seq2Seq → Seq2Seq+Attention → Transformer
Transformer 三大优势
- 并行计算:训练效率高
- 全局依赖:任意位置直接建模
- 可扩展性:规模越大效果越好
为什么选 Decoder-Only?
- 天然契合自由对话/自回归生成
- 参数利用率更高
- 普适性好(多数任务可转为“预测下一个 token”)
流程:分词 → Token ID → 嵌入 → 自注意力+前馈层(重复 N 次)→ 概率分布 → 采样 → 追加 → 循环
六、训练范式(预训练 + 后训练)
| 阶段 | 目标 | 数据 | 效果 |
|---|---|---|---|
| 预训练 | 学语言(词语接龙) | 海量无标注文本 | 有语言能力,无对话能力 |
| SFT | 学指令(如何回答) | 少量标注对话 | 初步指令遵循 |
| RLHF/RLAIF | 偏好对齐(更好更安全) | 人类/AI 偏好反馈 | 更稳定、更安全、更有帮助 |
效果对比:
- SFT 能挡直球,但多轮诱导可能滑向违规;RLHF 在多轮中更稳定守住边界
- SFT 回答稳妥但泛泛;RLHF 更具体、可操作
七、算力基础设施
芯片对比
- CPU:少量强核心,串行
- 传统 GPU:大量单功能计算单元
- 现代 GPU:增加矩阵计算单元(Tensor Core)
- NPU/TPU:专为神经网络设计
“算力不够”的三种瓶颈
- 显存容量:训练时需存参数+梯度+优化器状态+激活值;推理时还需 KV Cache
- 通信带宽:多卡并行时通信成瓶颈
- 纯算力(FLOPS):显存和通信够时才凸显
NVIDIA CUDA 生态
不止硬件强,更靠软件生态(编译、调优工具链)将理论性能转化为实际可用性能。
八、工程实现五模块
由低到高成本/复杂度:
提示词工程 → RAG → 微调 → 续训 → 智能体开发
1. 提示词工程
五要素:
- 角色/任务(你是谁,要干什么)
- 上下文(背景资料)
- 输入数据(本轮具体数据)
- 输出要求(格式、字段、示例)
- 约束(行为边界、信息来源)
消息结构(API 调用):
- System:稳定约束(角色/任务/输出要求/稳定上下文)
- User:用户输入
- Assistant:模型回答(追加到历史)
模型无记忆,需每轮发送完整历史。
2. RAG(检索增强生成)
- 用户请求 → 检索外部知识库 → 资料+请求 → 模型 → 有依据回答
- 适用:需最新信息、内部资料、资料过多超窗口
3. 微调
- 按 SFT 或 RLHF 范式继续训练
- 适用:指令遵循不足、风格不达标、需固化知识节省 token
- 方式:全参微调 或 高效微调(PEFT)
- 前提:数据充足 + 硬件够
4. 续训
- 沿用预训练范式继续训练
- 适用:模型系统性缺失领域语言/知识(读不懂)
- 数据量 > 微调,硬件要求更高
续训解决“读不懂”,微调解决“不会答”
5. 智能体(Agent)
- 大模型为推理核心 + 工具调用 + 记忆 + 规划
- 四要素:行动(必须)、工具(几乎总是)、规划(有条件)、记忆(最易省略)
- 适用:其他方式均不达预期时,复杂度最高
九、Function Call 与 MCP
Function Call 流程
- 用户提问 + 工具定义 → 模型
- 模型返回要调用的函数名和参数
- 代码执行函数,获取结果
- 结果 + 历史消息 → 模型
- 模型生成最终回答
MCP(Model Context Protocol)
- Anthropic 提出的标准化协议(2024.11)
- 三大能力:Tools(最常用)、Resources(数据源)、Prompts(提示词模板)
- 优势:
- 工具可跨应用复用
- 工具实现与模型适配解耦(n×m → n+m)
- 社区检验,可靠性更高
MCP 就像 AI 时代的 USB-C 接口,即插即用
十、工作流(Workflow)
- 将任务拆解为有序、可控步骤,按预定义流程执行
- 比 Agent 更确定、更可控
- 适用:流程固定、规则明确的任务
总结
理解大模型技术栈的逻辑主线:数据是基础,算力是支撑,架构是骨架,训练范式是方法,工程实现是落地路径。
- 简单任务 → 提示词工程
- 需要外部知识 → RAG
- 指令/风格不足 → 微调
- 读不懂领域语言 → 续训
- 复杂多步任务 → Agent / 工作流
更多推荐
所有评论(0)