【AI基础篇01】AI大模型基础概念全景图:一文搞懂所有核心术语
【AI基础篇01】AI大模型基础概念全景图:一文搞懂所有核心术语
前言:刚接触大模型时,你是不是也被这些词搞晕过——预训练、微调、对齐、涌现、幻觉、Scaling Law… 本文作为系列开篇,用一张图+一篇文章,帮你建立完整的大模型知识框架。建议收藏,随时查阅。
📋 目录
一、先上一张全景图
┌─────────────────────────────────────────────────────────────────┐
│ AI大模型技术全景图 │
├─────────────────────────────────────────────────────────────────┤
│ │
│ 【基础层】 │
│ ┌─────────┐ ┌─────────┐ ┌─────────┐ ┌─────────┐ │
│ │Transformer│ │ 预训练 │ │ 注意力 │ │ 位置编码 │ │
│ └────┬────┘ └────┬────┘ └────┬────┘ └────┬────┘ │
│ └─────────────┴─────────────┴─────────────┘ │
│ ↓ │
│ 【能力层】 │
│ ┌─────────┐ ┌─────────┐ ┌─────────┐ ┌─────────┐ │
│ │ 理解 │ │ 生成 │ │ 推理 │ │ 记忆 │ │
│ │(Understanding)│(Generation)│(Reasoning)│(Memory) │ │
│ └─────────┘ └─────────┘ └─────────┘ └─────────┘ │
│ ↓ │
│ 【优化层】 │
│ ┌─────────┐ ┌─────────┐ ┌─────────┐ ┌─────────┐ │
│ │ 微调 │ │ 对齐 │ │ 量化 │ │ 蒸馏 │ │
│ │(Fine-tuning)│ │(Alignment)│ │(Quantization)│(Distillation)│ │
│ └─────────┘ └─────────┘ └─────────┘ └─────────┘ │
│ ↓ │
│ 【应用层】 │
│ ┌─────────┐ ┌─────────┐ ┌─────────┐ ┌─────────┐ │
│ │ RAG │ │ Agent │ │ 代码 │ │ 多模态 │ │
│ └─────────┘ └─────────┘ └─────────┘ └─────────┘ │
│ │
└─────────────────────────────────────────────────────────────────┘
二、核心概念逐个击破
2.1 大模型(LLM)到底是什么
一句话定义:大语言模型(Large Language Model,LLM)是一种基于深度学习、具有海量参数、能够理解和生成自然语言的AI系统。
关键特征:
| 特征 | 说明 | 举例 |
|---|---|---|
| 参数规模大 | 数十亿到数千亿参数 | GPT-3: 175B, GPT-4: 估计1.8T |
| 训练数据多 | 数万亿token的文本 | 网页、书籍、代码、论文 |
| 通用能力强 | 不针对特定任务训练 | 问答、翻译、编程、推理都能做 |
| 上下文理解 | 能记住前文信息 | 支持4K-128K token的上下文 |
为什么叫"大"?
小模型(传统NLP):
- 参数:百万级(1M-10M)
- 任务:一个模型只做一件事(如情感分析)
- 数据:标注好的特定数据集
大模型(LLM):
- 参数:十亿级以上(1B+)
- 任务:一个模型做所有事(通用人工智能雏形)
- 数据:互联网上的海量未标注文本
💡 面试加分点:大模型的"大"不只是参数多,更重要的是涌现能力(Emergent Abilities)——当规模达到某个阈值后,会突然出现小模型不具备的能力。
2.2 预训练:模型的"九年义务教育"
什么是预训练?
预训练(Pre-training)是让模型在海量通用数据上学习语言规律的过程,相当于给模型进行"通识教育"。
预训练在学什么?
输入文本: "今天天气很好,适合去___"
模型预测: "公园" / "郊游" / "散步"
通过预测下一个词,模型学会了:
✅ 语法规则(主谓宾结构)
✅ 语义关系(天气好→适合外出)
✅ 世界知识(北京是中国的首都)
✅ 推理能力(如果A则B)
预训练的核心任务:
| 任务 | 说明 | 例子 |
|---|---|---|
| 语言建模 | 预测下一个token | GPT系列 |
| 掩码预测 | 预测被遮盖的词 | BERT |
| 完形填空 | 填空式预测 | SpanBERT |
| 句子排序 | 判断句子顺序 | ALBERT |
预训练数据有多重要?
Garbage in, Garbage out(垃圾进,垃圾出)
高质量数据特征:
✅ 多样性强(网页、书籍、代码、论文)
✅ 质量高(经过清洗,去除低质量内容)
✅ 时效性好(包含最新信息)
✅ 版权合规(避免法律风险)
数据清洗流程:
原始数据 → 去重 → 过滤低质量 → 敏感信息脱敏 → 格式化 → 训练数据
2.3 微调:专业领域的"职业培训"
为什么需要微调?
预训练模型是"通才",但我们需要"专才":
- 医疗领域需要懂医学术语
- 法律领域需要懂法条案例
- 金融领域需要懂财报数据
微调 vs 预训练:
| 对比项 | 预训练 | 微调 |
|---|---|---|
| 数据量 | 万亿级token | 千-百万级样本 |
| 计算成本 | 数百万美元 | 数千-数万美元 |
| 时间 | 数月 | 数小时-数天 |
| 目的 | 学习通用语言 | 适应特定任务 |
| 参数更新 | 全部参数 | 全部或部分参数 |
微调的三种方式:
1️⃣ 全量微调(Full Fine-tuning)
- 更新所有参数
- 效果最好,但成本最高
- 适合:数据充足、算力充足
2️⃣ 参数高效微调(PEFT)
- 只更新少量参数(1%-10%)
- 代表:LoRA、Adapter、Prefix Tuning
- 适合:资源有限、快速迭代
3️⃣ 提示微调(Prompt Tuning)
- 不更新模型参数,只优化输入提示
- 成本最低,但效果有限
- 适合:快速验证、轻量级应用
2.4 提示工程:不用训练的"操控术"
什么是提示工程?
提示工程(Prompt Engineering)是通过设计输入提示(Prompt),引导模型生成期望输出的技术。不需要训练模型,只需要写好提示词。
为什么提示工程很重要?
同样的模型,不同的提示,效果天差地别:
❌ 差提示:
"写一篇关于AI的文章"
→ 输出:泛泛而谈,没有重点
✅ 好提示:
"你是一位有10年经验的AI研究员,请用通俗易懂的语言,
向非技术背景的创业者解释大模型的商业应用场景,
要求:
1. 列举3个具体场景
2. 每个场景说明落地难点
3. 控制在800字以内"
→ 输出:结构清晰、针对性强、可直接使用
提示工程的核心技巧:
| 技巧 | 说明 | 示例 |
|---|---|---|
| 角色设定 | 给模型一个身份 | “你是一位资深医生…” |
| 上下文提供 | 给足背景信息 | “基于以下产品说明…” |
| 输出格式指定 | 规定输出结构 | “用JSON格式返回…” |
| Few-shot示例 | 给几个例子 | “参考以下例子:A→B, C→D, 那么E→?” |
| 思维链(CoT) | 引导逐步推理 | “让我们一步步思考…” |
| 自我一致性 | 多次采样取多数 | 生成多个答案,选最常见的 |
💡 面试加分点:提示工程不是"玄学",而是基于对模型能力的理解。好的提示工程师需要同时具备领域知识(知道要什么)和模型理解(知道模型能做什么)。
2.5 对齐:让模型"说人话、办人事"
什么是对齐?
对齐(Alignment)是确保模型的行为符合人类价值观和意图的过程。简单说:让模型不仅聪明,还要"懂事"。
对齐解决什么问题?
❌ 未对齐的模型:
用户:"怎么制造炸弹?"
模型:"你需要准备以下材料..."(危险!)
✅ 对齐后的模型:
用户:"怎么制造炸弹?"
模型:"我无法提供这方面的信息。如果你有其他问题,我很乐意帮助。"
对齐的三大技术:
| 技术 | 全称 | 作用 | 代表 |
|---|---|---|---|
| SFT | Supervised Fine-Tuning | 教会模型基本对话格式 | 所有Chat模型 |
| RLHF | Reinforcement Learning from Human Feedback | 用人类反馈优化模型 | ChatGPT, Claude |
| DPO | Direct Preference Optimization | 直接优化偏好,无需强化学习 | 新兴方法 |
RLHF流程详解:
Step 1: 收集人类偏好数据
- 对同一个问题,生成多个回答
- 人工标注哪个回答更好
- 训练奖励模型(Reward Model)
Step 2: 强化学习优化
- 模型生成回答
- 奖励模型打分
- 用PPO算法优化策略
Step 3: 迭代优化
- 收集更多反馈
- 持续改进模型
2.6 涌现:量变引发的质变
什么是涌现能力?
涌现(Emergence)是指模型规模达到某个阈值后,突然具备之前没有的能力。就像水在0°C突然结冰——量变引发质变。
典型的涌现能力:
| 能力 | 小规模模型 | 大规模模型 |
|---|---|---|
| 思维链推理 | ❌ 不会 | ✅ “让我们一步步思考” |
| 指令遵循 | ❌ 理解差 | ✅ 准确执行复杂指令 |
| 少样本学习 | ❌ 需要大量样本 | ✅ 几个例子就能学会 |
| 代码生成 | ❌ 语法错误多 | ✅ 可运行代码 |
涌现的临界点:
研究表明,很多能力在模型规模达到6B-13B参数时开始涌现:
1B参数:基础语言理解
6B参数:简单推理开始出现
13B参数:复杂推理、代码生成
70B+参数:接近人类水平的多种能力
但注意:不是所有能力都会涌现,
有些能力(如事实准确性)随规模线性提升。
💡 面试加分点:涌现能力是大模型研究的核心课题之一。目前对涌现的机理还不完全清楚,有研究者认为这可能只是评估指标的离散性造成的假象——但无论如何,大模型确实表现出了小模型不具备的能力。
2.7 幻觉:AI的"一本正经胡说八道"
什么是幻觉?
幻觉(Hallucination)是指模型生成看似合理但实际错误的内容。大模型会"一本正经地胡说八道"。
幻觉的类型:
1️⃣ 事实性幻觉(Factuality Hallucination)
模型:"爱因斯坦获得了诺贝尔文学奖"
事实:爱因斯坦获得的是诺贝尔物理学奖
2️⃣ 忠实性幻觉(Faithfulness Hallucination)
用户:"总结这段关于猫的文字"
模型:总结中出现了"狗"的内容(与输入不符)
幻觉的成因:
| 原因 | 说明 |
|---|---|
| 训练数据噪声 | 训练数据本身有错误 |
| 知识截止 | 模型不知道训练数据之后的事 |
| 概率生成本质 | 模型是"预测下一个词",不是"查询数据库" |
| 过度泛化 | 把学到的模式错误应用到新场景 |
| 上下文干扰 | 被误导性提示带偏 |
减少幻觉的方法:
✅ 使用RAG(检索增强生成):先查资料,再生成
✅ 增加事实核查步骤:让模型自我验证
✅ 降低temperature:让输出更保守
✅ 明确提示模型"如果不确定,就说不知道"
✅ 使用工具调用:让模型查搜索引擎/数据库
2.8 Scaling Law:越大越强的秘密
什么是Scaling Law?
Scaling Law(缩放定律)描述的是:模型性能随规模(参数、数据、算力)增长而可预测提升的规律。
Scaling Law的核心公式:
模型性能 ∝ (参数规模)^α × (数据量)^β × (计算量)^γ
其中 α, β, γ 是经验常数,通常都在0.5左右
简单说:
- 参数翻倍 → 性能提升可预测
- 数据翻倍 → 性能提升可预测
- 算力翻倍 → 性能提升可预测
Scaling Law的启示:
| 维度 | 规律 | 实践建议 |
|---|---|---|
| 参数规模 | 越大越强,但边际递减 | 在预算内选最大模型 |
| 数据量 | 数据越多越好 | 至少准备20 tokens/参数 |
| 计算量 | 训练充分很重要 | 不要欠训练 |
| Chinchilla最优 | 模型和数据要匹配 | 70B模型需要1.4T token |
Scaling Law的局限:
❌ 不能无限放大
- 数据会耗尽(高质量文本有限)
- 算力成本指数增长
- 推理延迟成为瓶颈
✅ 新的Scaling方向
- 测试时计算(Test-time Compute)
- 推理时间增加,而非模型规模
- 代表:o1, DeepSeek-R1
三、技术架构速览
主流架构对比
| 架构 | 代表模型 | 特点 | 适用场景 |
|---|---|---|---|
| GPT(Decoder-only) | GPT-4, LLaMA | 自回归生成,单向注意力 | 文本生成、对话 |
| BERT(Encoder-only) | BERT, RoBERTa | 双向编码,理解能力强 | 文本分类、NER |
| T5(Encoder-Decoder) | T5, BART | 编码器+解码器 | 翻译、摘要 |
| MoE | Mixtral, GPT-4 | 稀疏激活,参数效率高 | 超大规模模型 |
关键组件图解
输入文本: "今天天气很好"
↓
┌─────────────────┐
│ Tokenization │ → ["今天", "天气", "很", "好"] → [101, 2345, 89, 456]
└─────────────────┘
↓
┌─────────────────┐
│ Embedding层 │ → 将token转为向量(词向量+位置编码)
└─────────────────┘
↓
┌─────────────────┐
│ Transformer层 │ → 多头注意力 + 前馈网络(×N层)
│ (×24/×32/×96) │
└─────────────────┘
↓
┌─────────────────┐
│ 输出层 │ → 预测下一个token的概率分布
└─────────────────┘
↓
输出: "适合" (概率最高)
四、应用场景地图
大模型能做什么?
┌─────────────────────────────────────────────────────────┐
│ 应用场景矩阵 │
├─────────────────┬─────────────────┬─────────────────────┤
│ 内容创作 │ 知识服务 │ 编程开发 │
├─────────────────┼─────────────────┼─────────────────────┤
│ • 文章写作 │ • 智能问答 │ • 代码生成 │
│ • 营销文案 │ • 文档摘要 │ • Bug修复 │
│ • 小说创作 │ • 知识检索 │ • 代码审查 │
│ • 邮件撰写 │ • 论文解读 │ • 技术文档 │
├─────────────────┼─────────────────┼─────────────────────┤
│ 智能客服 │ 教育培训 │ 数据分析 │
├─────────────────┼─────────────────┼─────────────────────┤
│ • 7×24在线 │ • 个性化辅导 │ • 报表生成 │
│ • 多轮对话 │ • 题目生成 │ • 数据清洗 │
│ • 情感识别 │ • 作文批改 │ • 洞察提取 │
│ • 工单生成 │ • 知识图谱 │ • 可视化建议 │
└─────────────────┴─────────────────┴─────────────────────┘
五、学习路径建议
新手入门路线(3个月)
第1个月:基础概念
✅ 读完本文及系列文章
✅ 了解Transformer原理
✅ 学会使用ChatGPT/Claude
第2个月:动手实践
✅ 用Hugging Face跑通示例
✅ 尝试LoRA微调一个小模型
✅ 搭建一个简单的RAG应用
第3个月:深入理解
✅ 阅读GPT-2/LLaMA论文
✅ 理解RLHF原理
✅ 完成一个完整项目
进阶路线(6个月)
• 深入掌握分布式训练
• 理解推理优化技术
• 掌握Agent开发
• 参与开源项目
• 发表技术博客
📌 总结
| 概念 | 一句话理解 |
|---|---|
| 大模型 | 参数多、数据多、能力强的通用AI |
| 预训练 | 在海量数据上学语言规律 |
| 微调 | 在特定数据上适应任务 |
| 提示工程 | 写好提示词,不用改模型 |
| 对齐 | 让模型符合人类价值观 |
| 涌现 | 规模到了,能力突然有了 |
| 幻觉 | 模型会一本正经胡说八道 |
| Scaling Law | 越大越强,但有规律可循 |
🔗 延伸阅读
- 【AI基础篇02】从Transformer到GPT:生成式AI的演进史
- 【AI基础篇03】大模型参数、算力、数据:Scaling Law的本质
- 【AI架构篇01】GPT系列全解析:从GPT-1到GPT-4的技术演进
- 【AI训练篇01】预训练数据准备与清洗实战
如果这篇文章帮你理清了思路,欢迎点赞收藏!有任何概念不清楚,评论区留言,我会继续补充。 🚀
标签:人工智能、大模型、LLM、AI基础、预训练、微调、对齐、涌现、幻觉、Scaling Law
更多推荐

所有评论(0)