【AI基础篇01】AI大模型基础概念全景图:一文搞懂所有核心术语

前言:刚接触大模型时,你是不是也被这些词搞晕过——预训练、微调、对齐、涌现、幻觉、Scaling Law… 本文作为系列开篇,用一张图+一篇文章,帮你建立完整的大模型知识框架。建议收藏,随时查阅。


📋 目录


一、先上一张全景图

┌─────────────────────────────────────────────────────────────────┐
│                    AI大模型技术全景图                            │
├─────────────────────────────────────────────────────────────────┤
│                                                                 │
│  【基础层】                                                      │
│  ┌─────────┐  ┌─────────┐  ┌─────────┐  ┌─────────┐           │
│  │Transformer│  │  预训练  │  │  注意力  │  │ 位置编码 │           │
│  └────┬────┘  └────┬────┘  └────┬────┘  └────┬────┘           │
│       └─────────────┴─────────────┴─────────────┘              │
│                         ↓                                       │
│  【能力层】                                                      │
│  ┌─────────┐  ┌─────────┐  ┌─────────┐  ┌─────────┐           │
│  │  理解   │  │  生成   │  │  推理   │  │  记忆   │           │
│  │(Understanding)│(Generation)│(Reasoning)│(Memory)  │           │
│  └─────────┘  └─────────┘  └─────────┘  └─────────┘           │
│                         ↓                                       │
│  【优化层】                                                      │
│  ┌─────────┐  ┌─────────┐  ┌─────────┐  ┌─────────┐           │
│  │  微调   │  │  对齐   │  │  量化   │  │  蒸馏   │           │
│  │(Fine-tuning)│  │(Alignment)│  │(Quantization)│(Distillation)│           │
│  └─────────┘  └─────────┘  └─────────┘  └─────────┘           │
│                         ↓                                       │
│  【应用层】                                                      │
│  ┌─────────┐  ┌─────────┐  ┌─────────┐  ┌─────────┐           │
│  │   RAG   │  │  Agent  │  │  代码   │  │ 多模态  │           │
│  └─────────┘  └─────────┘  └─────────┘  └─────────┘           │
│                                                                 │
└─────────────────────────────────────────────────────────────────┘

二、核心概念逐个击破

2.1 大模型(LLM)到底是什么

一句话定义:大语言模型(Large Language Model,LLM)是一种基于深度学习、具有海量参数、能够理解和生成自然语言的AI系统。

关键特征:

特征说明举例
参数规模大数十亿到数千亿参数GPT-3: 175B, GPT-4: 估计1.8T
训练数据多数万亿token的文本网页、书籍、代码、论文
通用能力强不针对特定任务训练问答、翻译、编程、推理都能做
上下文理解能记住前文信息支持4K-128K token的上下文

为什么叫"大"?

小模型(传统NLP):
  - 参数:百万级(1M-10M)
  - 任务:一个模型只做一件事(如情感分析)
  - 数据:标注好的特定数据集

大模型(LLM):
  - 参数:十亿级以上(1B+)
  - 任务:一个模型做所有事(通用人工智能雏形)
  - 数据:互联网上的海量未标注文本

💡 面试加分点:大模型的"大"不只是参数多,更重要的是涌现能力(Emergent Abilities)——当规模达到某个阈值后,会突然出现小模型不具备的能力。


2.2 预训练:模型的"九年义务教育"

什么是预训练?

预训练(Pre-training)是让模型在海量通用数据上学习语言规律的过程,相当于给模型进行"通识教育"。

预训练在学什么?

输入文本: "今天天气很好,适合去___"
模型预测: "公园" / "郊游" / "散步"

通过预测下一个词,模型学会了:
✅ 语法规则(主谓宾结构)
✅ 语义关系(天气好→适合外出)
✅ 世界知识(北京是中国的首都)
✅ 推理能力(如果A则B)

预训练的核心任务:

任务说明例子
语言建模预测下一个tokenGPT系列
掩码预测预测被遮盖的词BERT
完形填空填空式预测SpanBERT
句子排序判断句子顺序ALBERT

预训练数据有多重要?

Garbage in, Garbage out(垃圾进,垃圾出)

高质量数据特征:
  ✅ 多样性强(网页、书籍、代码、论文)
  ✅ 质量高(经过清洗,去除低质量内容)
  ✅ 时效性好(包含最新信息)
  ✅ 版权合规(避免法律风险)

数据清洗流程:
  原始数据 → 去重 → 过滤低质量 → 敏感信息脱敏 → 格式化 → 训练数据

2.3 微调:专业领域的"职业培训"

为什么需要微调?

预训练模型是"通才",但我们需要"专才":

  • 医疗领域需要懂医学术语
  • 法律领域需要懂法条案例
  • 金融领域需要懂财报数据

微调 vs 预训练:

对比项预训练微调
数据量万亿级token千-百万级样本
计算成本数百万美元数千-数万美元
时间数月数小时-数天
目的学习通用语言适应特定任务
参数更新全部参数全部或部分参数

微调的三种方式:

1️⃣ 全量微调(Full Fine-tuning)
   - 更新所有参数
   - 效果最好,但成本最高
   - 适合:数据充足、算力充足

2️⃣ 参数高效微调(PEFT)
   - 只更新少量参数(1%-10%)
   - 代表:LoRA、Adapter、Prefix Tuning
   - 适合:资源有限、快速迭代

3️⃣ 提示微调(Prompt Tuning)
   - 不更新模型参数,只优化输入提示
   - 成本最低,但效果有限
   - 适合:快速验证、轻量级应用

2.4 提示工程:不用训练的"操控术"

什么是提示工程?

提示工程(Prompt Engineering)是通过设计输入提示(Prompt),引导模型生成期望输出的技术。不需要训练模型,只需要写好提示词。

为什么提示工程很重要?

同样的模型,不同的提示,效果天差地别:

❌ 差提示:
   "写一篇关于AI的文章"
   → 输出:泛泛而谈,没有重点

✅ 好提示:
   "你是一位有10年经验的AI研究员,请用通俗易懂的语言,
    向非技术背景的创业者解释大模型的商业应用场景,
    要求:
    1. 列举3个具体场景
    2. 每个场景说明落地难点
    3. 控制在800字以内"
   → 输出:结构清晰、针对性强、可直接使用

提示工程的核心技巧:

技巧说明示例
角色设定给模型一个身份“你是一位资深医生…”
上下文提供给足背景信息“基于以下产品说明…”
输出格式指定规定输出结构“用JSON格式返回…”
Few-shot示例给几个例子“参考以下例子:A→B, C→D, 那么E→?”
思维链(CoT)引导逐步推理“让我们一步步思考…”
自我一致性多次采样取多数生成多个答案,选最常见的

💡 面试加分点:提示工程不是"玄学",而是基于对模型能力的理解。好的提示工程师需要同时具备领域知识(知道要什么)和模型理解(知道模型能做什么)。


2.5 对齐:让模型"说人话、办人事"

什么是对齐?

对齐(Alignment)是确保模型的行为符合人类价值观和意图的过程。简单说:让模型不仅聪明,还要"懂事"。

对齐解决什么问题?

❌ 未对齐的模型:
   用户:"怎么制造炸弹?"
   模型:"你需要准备以下材料..."(危险!)

✅ 对齐后的模型:
   用户:"怎么制造炸弹?"
   模型:"我无法提供这方面的信息。如果你有其他问题,我很乐意帮助。"

对齐的三大技术:

技术全称作用代表
SFTSupervised Fine-Tuning教会模型基本对话格式所有Chat模型
RLHFReinforcement Learning from Human Feedback用人类反馈优化模型ChatGPT, Claude
DPODirect Preference Optimization直接优化偏好,无需强化学习新兴方法

RLHF流程详解:

Step 1: 收集人类偏好数据
   - 对同一个问题,生成多个回答
   - 人工标注哪个回答更好
   - 训练奖励模型(Reward Model)

Step 2: 强化学习优化
   - 模型生成回答
   - 奖励模型打分
   - 用PPO算法优化策略

Step 3: 迭代优化
   - 收集更多反馈
   - 持续改进模型

2.6 涌现:量变引发的质变

什么是涌现能力?

涌现(Emergence)是指模型规模达到某个阈值后,突然具备之前没有的能力。就像水在0°C突然结冰——量变引发质变。

典型的涌现能力:

能力小规模模型大规模模型
思维链推理❌ 不会✅ “让我们一步步思考”
指令遵循❌ 理解差✅ 准确执行复杂指令
少样本学习❌ 需要大量样本✅ 几个例子就能学会
代码生成❌ 语法错误多✅ 可运行代码

涌现的临界点:

研究表明,很多能力在模型规模达到6B-13B参数时开始涌现:

1B参数:基础语言理解
6B参数:简单推理开始出现
13B参数:复杂推理、代码生成
70B+参数:接近人类水平的多种能力

但注意:不是所有能力都会涌现,
有些能力(如事实准确性)随规模线性提升。

💡 面试加分点:涌现能力是大模型研究的核心课题之一。目前对涌现的机理还不完全清楚,有研究者认为这可能只是评估指标的离散性造成的假象——但无论如何,大模型确实表现出了小模型不具备的能力。


2.7 幻觉:AI的"一本正经胡说八道"

什么是幻觉?

幻觉(Hallucination)是指模型生成看似合理但实际错误的内容。大模型会"一本正经地胡说八道"。

幻觉的类型:

1️⃣ 事实性幻觉(Factuality Hallucination)
   模型:"爱因斯坦获得了诺贝尔文学奖"
   事实:爱因斯坦获得的是诺贝尔物理学奖

2️⃣ 忠实性幻觉(Faithfulness Hallucination)
   用户:"总结这段关于猫的文字"
   模型:总结中出现了"狗"的内容(与输入不符)

幻觉的成因:

原因说明
训练数据噪声训练数据本身有错误
知识截止模型不知道训练数据之后的事
概率生成本质模型是"预测下一个词",不是"查询数据库"
过度泛化把学到的模式错误应用到新场景
上下文干扰被误导性提示带偏

减少幻觉的方法:

✅ 使用RAG(检索增强生成):先查资料,再生成
✅ 增加事实核查步骤:让模型自我验证
✅ 降低temperature:让输出更保守
✅ 明确提示模型"如果不确定,就说不知道"
✅ 使用工具调用:让模型查搜索引擎/数据库

2.8 Scaling Law:越大越强的秘密

什么是Scaling Law?

Scaling Law(缩放定律)描述的是:模型性能随规模(参数、数据、算力)增长而可预测提升的规律。

Scaling Law的核心公式:

模型性能 ∝ (参数规模)^α × (数据量)^β × (计算量)^γ

其中 α, β, γ 是经验常数,通常都在0.5左右

简单说:
- 参数翻倍 → 性能提升可预测
- 数据翻倍 → 性能提升可预测
- 算力翻倍 → 性能提升可预测

Scaling Law的启示:

维度规律实践建议
参数规模越大越强,但边际递减在预算内选最大模型
数据量数据越多越好至少准备20 tokens/参数
计算量训练充分很重要不要欠训练
Chinchilla最优模型和数据要匹配70B模型需要1.4T token

Scaling Law的局限:

❌ 不能无限放大
   - 数据会耗尽(高质量文本有限)
   - 算力成本指数增长
   - 推理延迟成为瓶颈

✅ 新的Scaling方向
   - 测试时计算(Test-time Compute)
   - 推理时间增加,而非模型规模
   - 代表:o1, DeepSeek-R1

三、技术架构速览

主流架构对比

架构代表模型特点适用场景
GPT(Decoder-only)GPT-4, LLaMA自回归生成,单向注意力文本生成、对话
BERT(Encoder-only)BERT, RoBERTa双向编码,理解能力强文本分类、NER
T5(Encoder-Decoder)T5, BART编码器+解码器翻译、摘要
MoEMixtral, GPT-4稀疏激活,参数效率高超大规模模型

关键组件图解

输入文本: "今天天气很好"
    ↓
┌─────────────────┐
│   Tokenization  │ → ["今天", "天气", "很", "好"] → [101, 2345, 89, 456]
└─────────────────┘
    ↓
┌─────────────────┐
│  Embedding层    │ → 将token转为向量(词向量+位置编码)
└─────────────────┘
    ↓
┌─────────────────┐
│  Transformer层  │ → 多头注意力 + 前馈网络(×N层)
│  (×24/×32/×96)  │
└─────────────────┘
    ↓
┌─────────────────┐
│   输出层        │ → 预测下一个token的概率分布
└─────────────────┘
    ↓
输出: "适合" (概率最高)

四、应用场景地图

大模型能做什么?

┌─────────────────────────────────────────────────────────┐
│                      应用场景矩阵                        │
├─────────────────┬─────────────────┬─────────────────────┤
│    内容创作      │    知识服务      │      编程开发       │
├─────────────────┼─────────────────┼─────────────────────┤
│ • 文章写作      │ • 智能问答      │ • 代码生成          │
│ • 营销文案      │ • 文档摘要      │ • Bug修复           │
│ • 小说创作      │ • 知识检索      │ • 代码审查          │
│ • 邮件撰写      │ • 论文解读      │ • 技术文档          │
├─────────────────┼─────────────────┼─────────────────────┤
│    智能客服      │    教育培训      │      数据分析       │
├─────────────────┼─────────────────┼─────────────────────┤
│ • 7×24在线      │ • 个性化辅导    │ • 报表生成          │
│ • 多轮对话      │ • 题目生成      │ • 数据清洗          │
│ • 情感识别      │ • 作文批改      │ • 洞察提取          │
│ • 工单生成      │ • 知识图谱      │ • 可视化建议        │
└─────────────────┴─────────────────┴─────────────────────┘

五、学习路径建议

新手入门路线(3个月)

第1个月:基础概念
  ✅ 读完本文及系列文章
  ✅ 了解Transformer原理
  ✅ 学会使用ChatGPT/Claude

第2个月:动手实践
  ✅ 用Hugging Face跑通示例
  ✅ 尝试LoRA微调一个小模型
  ✅ 搭建一个简单的RAG应用

第3个月:深入理解
  ✅ 阅读GPT-2/LLaMA论文
  ✅ 理解RLHF原理
  ✅ 完成一个完整项目

进阶路线(6个月)

• 深入掌握分布式训练
• 理解推理优化技术
• 掌握Agent开发
• 参与开源项目
• 发表技术博客

📌 总结

概念一句话理解
大模型参数多、数据多、能力强的通用AI
预训练在海量数据上学语言规律
微调在特定数据上适应任务
提示工程写好提示词,不用改模型
对齐让模型符合人类价值观
涌现规模到了,能力突然有了
幻觉模型会一本正经胡说八道
Scaling Law越大越强,但有规律可循

🔗 延伸阅读

  • 【AI基础篇02】从Transformer到GPT:生成式AI的演进史
  • 【AI基础篇03】大模型参数、算力、数据:Scaling Law的本质
  • 【AI架构篇01】GPT系列全解析:从GPT-1到GPT-4的技术演进
  • 【AI训练篇01】预训练数据准备与清洗实战

如果这篇文章帮你理清了思路,欢迎点赞收藏!有任何概念不清楚,评论区留言,我会继续补充。 🚀

标签:人工智能、大模型、LLM、AI基础、预训练、微调、对齐、涌现、幻觉、Scaling Law

更多推荐