大模型关键术语全解:读懂这篇就够了

从A到Z,一文搞懂大模型所有核心概念


🌟 引言

大模型的世界充满了各种专业术语:Token、Embedding、Temperature、LoRA、RLHF…这些词听起来像外星语言,但它们是理解AI的钥匙。

这篇文章将用最通俗的语言,解释大模型领域最重要的100+个关键术语。读完这篇,你就能自信地和大模型"对话"了!


📚 第一部分:基础概念篇

1.1 大模型相关

术语英文全称解释
大语言模型Large Language Model (LLM)参数规模巨大的预训练语言模型,通常指参数量在10亿以上的模型。如GPT-4、Claude、文心一言等。
生成式AIGenerative AI能够创造新内容的AI,如生成文本、图像、代码等,而不是仅仅分类或识别。
预训练Pre-training在海量数据上训练模型的初始阶段,让模型学习语言的基本规律和世界知识。
微调Fine-tuning在预训练模型基础上,用特定领域数据进一步训练,让模型适应特定任务。
基础模型Foundation Model在大规模数据上预训练的通用模型,可以作为多种任务的基础。

1.2 模型架构相关

术语英文全称解释
TransformerTransformer现代大模型的核心架构,基于自注意力机制,能够并行处理文本。
自注意力机制Self-Attention让模型在处理每个词时,能够关注到句子中其他相关词的机制。
多头注意力Multi-Head Attention从多个角度(多个"头")同时关注文本的不同特征。
编码器EncoderTransformer的一部分,负责理解和编码输入信息。
解码器DecoderTransformer的一部分,负责生成输出内容。
仅解码器模型Decoder-only只使用Transformer解码器部分的模型,如GPT系列,擅长生成任务。
仅编码器模型Encoder-only只使用Transformer编码器部分的模型,如BERT,擅长理解任务。
编码器-解码器模型Encoder-Decoder同时使用编码器和解码器的模型,如T5,适合翻译等任务。

1.3 数据相关

术语英文全称解释
TokenToken文本的最小处理单元。可以是一个词、一个词的一部分、甚至一个字符。
分词Tokenization将文本切分成Token的过程。
分词器Tokenizer执行分词的工具,不同模型使用不同的分词器。
词表Vocabulary模型知道的所有Token的集合。
上下文窗口Context Window模型一次能处理的最大Token数量。如GPT-4的上下文窗口是128K。
训练数据Training Data用于训练模型的数据集。
验证数据Validation Data用于在训练过程中评估模型性能的数据。
测试数据Test Data用于最终评估模型性能的数据。

🧠 第二部分:模型内部机制篇

2.1 表示学习

术语英文全称解释
嵌入/词向量Embedding将词、句子或其他内容转换为数字向量的表示,相似的内容有相似的向量。
词嵌入Word Embedding将词转换为固定长度的向量表示。
位置编码Positional Encoding给Token添加位置信息,让模型知道词的顺序。
隐藏状态Hidden State模型内部层的输出表示。
表示Representation内容在模型内部的数学表示。

2.2 训练过程

术语英文全称解释
前向传播Forward Pass输入数据通过模型得到输出的过程。
反向传播Backpropagation根据误差调整模型参数的过程。
损失函数Loss Function衡量模型预测与真实答案差距的函数。
梯度Gradient损失函数对参数的导数,指示如何调整参数。
梯度下降Gradient Descent沿着梯度的反方向调整参数,减小损失。
学习率Learning Rate参数调整的步长,太大可能不稳定,太小收敛慢。
轮次Epoch完整遍历训练数据一次。
批次大小Batch Size一次训练使用的样本数量。
优化器Optimizer调整模型参数的算法,如Adam、SGD等。
权重衰减Weight Decay防止模型过拟合的正则化技术。
DropoutDropout随机丢弃部分神经元,防止过拟合。

2.3 模型参数

术语英文全称解释
参数Parameters模型中可学习的数值,包括权重和偏置。
权重Weights模型中连接神经元的数值。
偏置Bias模型中每个神经元的偏移量。
参数量Parameter Count模型中参数的总数,如"7B模型"表示70亿参数。
激活函数Activation Function引入非线性的函数,如ReLU、GELU等。
层归一化Layer Normalization标准化每层的输出,稳定训练过程。
残差连接Residual Connection将层的输入直接加到输出上,帮助梯度流动。

🎯 第三部分:提示工程篇

3.1 提示基础

术语英文全称解释
提示词Prompt给大模型的输入文本,引导模型生成期望的输出。
提示工程Prompt Engineering设计和优化提示词的技术。
系统提示词System Prompt设定模型角色和行为的全局提示。
用户提示词User Prompt用户的具体问题或指令。
少样本学习Few-shot Learning在提示中提供几个示例,让模型学习模式。
零样本学习Zero-shot Learning不提供示例,直接让模型完成任务。
单样本学习One-shot Learning只提供一个示例的学习方式。

3.2 高级提示技术

术语英文全称解释
思维链Chain of Thought (CoT)引导模型逐步推理,展示思考过程。
思维树Tree of Thoughts (ToT)探索多个推理路径,选择最优解。
自一致性Self-Consistency多次生成答案,选择最一致的结果。
提示链Prompt Chaining将多个提示串联使用,前一个的输出作为后一个的输入。
提示模板Prompt Template可复用的提示结构,包含变量占位符。
角色提示Role Prompting为模型设定专业角色,如"你是一位律师"。
指令提示Instruction Prompting明确告诉模型要做什么。

3.3 生成控制

术语英文全称解释
温度Temperature控制生成随机性的参数。值越高越随机,值越低越确定。
Top-P采样Nucleus Sampling从累计概率达到P的最可能Token中采样。
Top-K采样Top-K Sampling从概率最高的K个Token中采样。
束搜索Beam Search保留多个候选序列,选择最优的。
重复惩罚Repetition Penalty减少重复生成相同内容的倾向。
频率惩罚Frequency Penalty根据Token出现频率进行惩罚。
存在惩罚Presence Penalty只要Token出现过就进行惩罚。
停止序列Stop Sequence遇到特定序列时停止生成。
最大Token数Max Tokens限制生成的最大Token数量。

🤖 第四部分:AI Agent篇

4.1 Agent基础

术语英文全称解释
AI智能体AI Agent具备自主决策和执行能力的AI系统,可以调用工具、规划任务。
ReAct模式ReActReasoning(推理)+ Acting(行动)的循环模式。
工具调用Tool Calling / Function Calling模型调用外部函数或API的能力。
记忆MemoryAgent存储和检索信息的能力。
短期记忆Short-term Memory当前对话中的信息。
长期记忆Long-term Memory跨会话持久存储的信息。
向量存储Vector Store用向量数据库存储和检索记忆。

4.2 Agent能力

术语英文全称解释
规划PlanningAgent分解任务、制定执行计划的能力。
反思ReflectionAgent检查和改进自己输出的能力。
自我修正Self-CorrectionAgent发现错误并自动修正的能力。
多Agent协作Multi-Agent Collaboration多个Agent协同完成复杂任务。
Agent框架Agent Framework开发Agent的工具库,如LangChain、CrewAI等。

🔍 第五部分:RAG篇

5.1 RAG基础

术语英文全称解释
检索增强生成Retrieval-Augmented Generation (RAG)先检索相关文档,再基于检索内容生成答案的技术。
检索Retrieval从知识库中查找相关内容的过程。
增强Augmentation将检索内容注入提示的过程。
生成Generation基于增强内容生成答案的过程。

5.2 RAG组件

术语英文全称解释
文档加载器Document Loader加载不同格式文档的工具。
文本分割器Text Splitter将长文档切分成小块的工具。
向量数据库Vector Database专门存储和检索向量数据的数据库。
嵌入模型Embedding Model将文本转换为向量的模型。
检索器Retriever执行检索操作的组件。
重排序器Reranker对检索结果重新排序的模型。

5.3 RAG技术

术语英文全称解释
相似度检索Similarity Search基于向量相似度检索文档。
混合检索Hybrid Search结合向量检索和关键词检索。
最大边界相关性MMR平衡相关性和多样性的检索策略。
查询扩展Query Expansion改写和扩展查询,提高检索效果。
元数据过滤Metadata Filtering基于元数据筛选检索结果。
上下文压缩Context Compression压缩检索内容,保留关键信息。

🔧 第六部分:模型微调篇

6.1 微调类型

术语英文全称解释
全量微调Full Fine-tuning更新模型所有参数的微调方式。
高效微调PEFT只更新少量参数的微调方式。
LoRALow-Rank Adaptation低秩适应微调,只训练少量低秩矩阵。
QLoRAQuantized LoRA量化+LoRA,进一步降低显存需求。
Prefix TuningPrefix Tuning只优化提示前缀向量的微调方法。
Prompt TuningPrompt Tuning优化软提示的微调方法。
适配器Adapter在模型层之间插入小型可训练模块。

6.2 微调数据

术语英文全称解释
指令数据Instruction Data包含指令和期望输出的数据。
对话数据Conversation Data多轮对话格式的数据。
偏好数据Preference Data包含人类偏好的成对数据。
合成数据Synthetic Data用AI生成的训练数据。
数据增强Data Augmentation通过变换增加数据多样性的技术。

6.3 微调技术

术语英文全称解释
有监督微调SFT使用标注数据进行的微调。
指令微调Instruction Tuning让模型学会遵循指令的微调。
对齐微调Alignment Tuning让模型输出符合人类价值观的微调。
持续预训练Continual Pre-training在领域数据上继续预训练。
多任务微调Multi-task Fine-tuning同时在多个任务上微调。

🛡️ 第七部分:模型对齐篇

7.1 对齐方法

术语英文全称解释
人类反馈强化学习RLHF用人类反馈训练奖励模型,再用强化学习优化大模型。
奖励模型Reward Model预测人类对输出偏好的模型。
PPOPPO常用的强化学习算法。
直接偏好优化DPO直接用偏好数据优化模型,不需要奖励模型。
KTOKTO基于前景理论的优化方法。
ORPOORPO基于胜率的偏好优化方法。

7.2 对齐技术

术语英文全称解释
Constitutional AIConstitutional AI基于规则和原则的对齐方法。
红队测试Red Teaming故意攻击模型,发现安全问题。
安全对齐Safety Alignment让模型避免生成有害内容。
有用性对齐Helpfulness Alignment让模型生成更有用的回答。
诚实性对齐Honesty Alignment让模型避免编造信息。

🚀 第八部分:模型部署篇

8.1 部署方式

术语英文全称解释
云端部署Cloud Deployment在云服务器上部署模型。
本地部署Local Deployment在本地机器上运行模型。
边缘部署Edge Deployment在边缘设备上部署模型。
API服务API Service提供HTTP接口的模型服务。
流式输出Streaming逐Token生成并返回,提升用户体验。

8.2 推理优化

术语英文全称解释
推理Inference用模型生成输出的过程。
推理引擎Inference Engine优化推理速度的工具。
批处理Batching同时处理多个请求。
连续批处理Continuous Batching动态调整批处理,提高效率。
键值缓存KV Cache缓存注意力计算的中间结果,加速生成。
量化Quantization降低模型参数精度,减少显存占用。
INT8量化INT8 Quantization将参数从32位浮点数量化为8位整数。
INT4量化INT4 Quantization将参数量化为4位整数。
FP16/BF16FP16/BF16半精度浮点数,减少显存占用。
GPTQGPTQ一种高效的量化方法。
AWQAWQ考虑激活值的量化方法。
GGUFGGUFllama.cpp使用的量化格式。

8.3 部署工具

术语英文全称解释
vLLMvLLM高性能推理引擎,支持PagedAttention。
TGITGIHugging Face的推理服务。
TensorRT-LLMTensorRT-LLMNVIDIA优化的推理框架。
llama.cppllama.cpp纯C++实现的推理引擎,支持CPU。
OllamaOllama本地模型运行工具。
LM StudioLM Studio本地模型管理工具。

📊 第九部分:评估篇

9.1 评估指标

术语英文全称解释
困惑度Perplexity (PPL)衡量模型预测不确定性的指标,越低越好。
准确率Accuracy预测正确的比例。
BLEUBLEU机器翻译评估指标。
ROUGEROUGE文本摘要评估指标。
F1分数F1 Score精确率和召回率的调和平均。
精确率Precision预测为正的样本中真正为正的比例。
召回率Recall真正为正的样本中被预测为正的比例。

9.2 评估基准

术语英文全称解释
MMLUMMLU综合知识评估基准。
GSM8KGSM8K数学推理评估基准。
HumanEvalHumanEval代码生成评估基准。
BBHBBH复杂任务评估基准。
TruthfulQATruthfulQA事实准确性评估基准。
MT-BenchMT-Bench多轮对话评估基准。
AlpacaEvalAlpacaEval指令遵循评估基准。

9.3 RAG评估

术语英文全称解释
RAGASRAGASRAG系统评估框架。
TruLensTruLensRAG评估工具。
DeepEvalDeepEval大模型评估框架。
忠实度Faithfulness回答是否基于检索内容。
相关性Relevance回答是否与问题相关。
上下文召回率Context Recall检索内容是否包含答案。

🔨 第十部分:开发工具篇

10.1 核心库

术语英文全称解释
TransformersTransformersHugging Face的模型库。
PyTorchPyTorch深度学习框架。
TensorFlowTensorFlowGoogle的深度学习框架。
LangChainLangChain大模型应用开发框架。
LlamaIndexLlamaIndex数据索引和检索框架。
OpenAI APIOpenAI APIOpenAI的接口服务。
Anthropic APIAnthropic APIClaude的接口服务。

10.2 向量数据库

术语英文全称解释
ChromaChroma轻量级本地向量数据库。
FAISSFAISSFacebook的相似度搜索库。
PineconePinecone托管向量数据库服务。
MilvusMilvus开源向量数据库。
QdrantQdrant高性能向量搜索引擎。
WeaviateWeaviate开源向量数据库。

10.3 平台与社区

术语英文全称解释
Hugging FaceHugging FaceAI模型和数据集平台。
魔搭社区ModelScope中国的AI模型平台。
GitHubGitHub代码托管平台。
KaggleKaggle数据科学竞赛平台。
Papers with CodePapers with Code论文和代码对应平台。
arXivarXiv预印本论文平台。

🌐 第十一部分:前沿技术篇

11.1 新兴架构

术语英文全称解释
混合专家Mixture of Experts (MoE)只激活部分专家网络,提高效率。
稀疏注意力Sparse Attention只计算部分位置的注意力,降低复杂度。
Flash AttentionFlash Attention优化的注意力计算实现。
Ring AttentionRing Attention环状注意力,支持超长上下文。
LongLoRALongLoRA支持长上下文的LoRA变体。

11.2 多模态

术语英文全称解释
多模态模型Multimodal Model能处理多种数据类型(文本、图像、音频)的模型。
视觉TransformerVision Transformer (ViT)用于图像的Transformer架构。
CLIPCLIP连接文本和图像的模型。
DALL-EDALL-E文本生成图像的模型。
Stable DiffusionStable Diffusion图像生成模型。

11.3 其他前沿

术语英文全称解释
世界模型World Model理解世界规律的模型。
具身智能Embodied AI能与物理世界交互的AI。
神经符号AINeuro-symbolic AI结合神经网络和符号推理的AI。
小模型Small Language Model (SLM)参数量较小但性能优秀的模型。

💡 第十二部分:常见问题篇

12.1 模型能力

术语英文全称解释
幻觉Hallucination模型编造不存在事实的现象。
知识截止Knowledge Cutoff模型训练数据的截止时间。
上下文学习In-Context Learning (ICL)通过上下文示例学习的能力。
涌现能力Emergent Abilities模型规模达到一定程度后突然出现的能力。
思维链推理Chain-of-Thought Reasoning逐步推理的能力。
零样本推理Zero-shot Reasoning不提供示例直接推理的能力。

12.2 训练相关

术语英文全称解释
过拟合Overfitting模型在训练数据上表现好,在新数据上表现差。
欠拟合Underfitting模型连训练数据都学不好。
灾难性遗忘Catastrophic Forgetting学习新任务后忘记旧任务。
梯度爆炸Gradient Explosion梯度变得过大,训练不稳定。
梯度消失Gradient Vanishing梯度变得过小,无法有效训练。
收敛Convergence模型训练达到稳定状态。

12.3 资源相关

术语英文全称解释
显存VRAM显卡内存,存储模型和中间结果。
浮点运算次数FLOPs衡量计算量的指标。
吞吐量Throughput单位时间处理的请求数量。
延迟Latency从请求到返回的时间。
张量处理单元TPUGoogle的AI加速芯片。
神经网络处理单元NPU神经网络处理单元。

📖 术语速查表

类别核心术语
基础LLM、Token、Embedding、Transformer
提示Prompt、CoT、Temperature、Few-shot
AgentAgent、Tool Calling、Memory、ReAct
RAGRAG、Vector DB、Retriever、Embedding
微调LoRA、QLoRA、SFT、PEFT
对齐RLHF、DPO、Reward Model
部署vLLM、Quantization、Inference
评估MMLU、GSM8K、Perplexity

🎯 学习建议

初学者必知术语(Top 20)

序号术语英文所属领域
1大语言模型LLM基础
2词元Token基础
3提示词Prompt提示
4嵌入Embedding基础
5Transformer架构Transformer架构
6上下文窗口Context Window基础
7温度Temperature提示
8少样本学习Few-shot Learning提示
9检索增强生成RAGRAG
10智能体AgentAgent
11微调Fine-tuning微调
12低秩适应LoRA微调
13人类反馈强化学习RLHF对齐
14幻觉Hallucination问题
15推理Inference部署
16量化Quantization部署
17向量数据库Vector DatabaseRAG
18思维链Chain of Thought提示
19预训练Pre-training基础
20评估基准MMLU评估

进阶学习者关注

术语英文说明
混合专家MoE提高效率的架构
Flash AttentionFlash Attention加速注意力计算
直接偏好优化DPO简化对齐流程
分页注意力PagedAttentionvLLM的核心技术
长上下文Long Context处理更长文本

🌟 结语

大模型的术语虽然多,但都有其内在逻辑:

  • 数据层面:Token、Embedding、Context
  • 模型层面:Transformer、Attention、Parameters
  • 训练层面:Pre-training、Fine-tuning、RLHF
  • 应用层面:Prompt、RAG、Agent
  • 部署层面:Inference、Quantization、vLLM
  • 评估层面:MMLU、Perplexity、RAGAS

理解了这些术语,你就掌握了与大模型对话的"语言"。继续探索,AI的世界无限精彩!


希望这篇术语大全能成为你学习大模型的得力助手!有问题随时查阅哦~ 📚✨

更多推荐