大模型核心知识精要


一、大模型是什么

  • 参数规模:通常 ≥ 10 亿,顶尖达万亿级
  • 训练数据:自监督学习,使用海量未标注文本(如 Qwen3 用 36T token)
  • 能力:跨任务泛化,单一模型可完成多种任务

三大促成因素:数据够多 + 算力够强 + Transformer 架构可扩展

计量单位

  • 参数规模:B(Billion,10⁹)
  • 数据集:T token(10¹² token)
  • 计算量:E FLOPs(10¹⁸ FLOPs)
  • 算力:P FLOPS(10¹⁵ FLOPS/秒)

二、模型分类

类型输入输出代表
生成式上下文文本/图像/音频GPT, Qwen, DeepSeek, DALL·E
嵌入模型文本/多模态固定维度向量BGE, Qwen-Embedding
重排序模型(query, doc)相关性分数BGE-Reranker
判别模型各种模态标签/概率BERT 微调小模型

按模态分(生成模型)

  • LLM:文本→文本(Qwen3, DeepSeek-V3)
  • 多模态理解:文本+图像/音视频→文本(Qwen-VL)
  • 多模态生成:文生图/视频/音频(Stable Diffusion, Sora)

三、AIGC vs AGI

  • AIGC:用 AI 生成内容(已实现)
  • AGI:通用人工智能,能自主学习并解决大多数人类问题(尚未实现)

四、开源生态

  • 大模型“开源”主要指开源权重,可能含推理代码,通常不含训练代码和数据集
  • 开源代表:DeepSeek, Qwen, Llama
  • 闭源代表:GPT(早期除外), Gemini, Claude

五、架构演进与选型

演进路径

RNN → LSTM → GRU → Seq2Seq → Seq2Seq+Attention → Transformer

Transformer 三大优势

  1. 并行计算:训练效率高
  2. 全局依赖:任意位置直接建模
  3. 可扩展性:规模越大效果越好

为什么选 Decoder-Only?

  • 天然契合自由对话/自回归生成
  • 参数利用率更高
  • 普适性好(多数任务可转为“预测下一个 token”)

流程:分词 → Token ID → 嵌入 → 自注意力+前馈层(重复 N 次)→ 概率分布 → 采样 → 追加 → 循环


六、训练范式(预训练 + 后训练)

阶段目标数据效果
预训练学语言(词语接龙)海量无标注文本有语言能力,无对话能力
SFT学指令(如何回答)少量标注对话初步指令遵循
RLHF/RLAIF偏好对齐(更好更安全)人类/AI 偏好反馈更稳定、更安全、更有帮助

效果对比

  • SFT 能挡直球,但多轮诱导可能滑向违规;RLHF 在多轮中更稳定守住边界
  • SFT 回答稳妥但泛泛;RLHF 更具体、可操作

七、算力基础设施

芯片对比

  • CPU:少量强核心,串行
  • 传统 GPU:大量单功能计算单元
  • 现代 GPU:增加矩阵计算单元(Tensor Core)
  • NPU/TPU:专为神经网络设计

“算力不够”的三种瓶颈

  • 显存容量:训练时需存参数+梯度+优化器状态+激活值;推理时还需 KV Cache
  • 通信带宽:多卡并行时通信成瓶颈
  • 纯算力(FLOPS):显存和通信够时才凸显

NVIDIA CUDA 生态

不止硬件强,更靠软件生态(编译、调优工具链)将理论性能转化为实际可用性能。


八、工程实现五模块

由低到高成本/复杂度:

提示词工程 → RAG → 微调 → 续训 → 智能体开发

1. 提示词工程

五要素

  • 角色/任务(你是谁,要干什么)
  • 上下文(背景资料)
  • 输入数据(本轮具体数据)
  • 输出要求(格式、字段、示例)
  • 约束(行为边界、信息来源)

消息结构(API 调用)

  • System:稳定约束(角色/任务/输出要求/稳定上下文)
  • User:用户输入
  • Assistant:模型回答(追加到历史)

模型无记忆,需每轮发送完整历史。

2. RAG(检索增强生成)

  • 用户请求 → 检索外部知识库 → 资料+请求 → 模型 → 有依据回答
  • 适用:需最新信息、内部资料、资料过多超窗口

3. 微调

  • 按 SFT 或 RLHF 范式继续训练
  • 适用:指令遵循不足、风格不达标、需固化知识节省 token
  • 方式:全参微调 或 高效微调(PEFT)
  • 前提:数据充足 + 硬件够

4. 续训

  • 沿用预训练范式继续训练
  • 适用:模型系统性缺失领域语言/知识(读不懂)
  • 数据量 > 微调,硬件要求更高

续训解决“读不懂”,微调解决“不会答”

5. 智能体(Agent)

  • 大模型为推理核心 + 工具调用 + 记忆 + 规划
  • 四要素:行动(必须)、工具(几乎总是)、规划(有条件)、记忆(最易省略)
  • 适用:其他方式均不达预期时,复杂度最高

九、Function Call 与 MCP

Function Call 流程

  1. 用户提问 + 工具定义 → 模型
  2. 模型返回要调用的函数名和参数
  3. 代码执行函数,获取结果
  4. 结果 + 历史消息 → 模型
  5. 模型生成最终回答

MCP(Model Context Protocol)

  • Anthropic 提出的标准化协议(2024.11)
  • 三大能力:Tools(最常用)、Resources(数据源)、Prompts(提示词模板)
  • 优势
    • 工具可跨应用复用
    • 工具实现与模型适配解耦(n×m → n+m)
    • 社区检验,可靠性更高

MCP 就像 AI 时代的 USB-C 接口,即插即用


十、工作流(Workflow)

  • 将任务拆解为有序、可控步骤,按预定义流程执行
  • 比 Agent 更确定、更可控
  • 适用:流程固定、规则明确的任务

总结

理解大模型技术栈的逻辑主线:数据是基础,算力是支撑,架构是骨架,训练范式是方法,工程实现是落地路径

  • 简单任务 → 提示词工程
  • 需要外部知识 → RAG
  • 指令/风格不足 → 微调
  • 读不懂领域语言 → 续训
  • 复杂多步任务 → Agent / 工作流

更多推荐