AI大模型-常用名词
·
部分内容可能来自网络或者由AI生成。
如有雷同,纯属巧合,仅供学习参考之用。
一、基础概念类
| 中文术语 | 英文术语 | 英文缩写 | 说明 |
|---|---|---|---|
| 大语言模型 | Large Language Model | LLM | 基于海量文本数据(网页文本、书籍文献、代码库等数万亿词汇量的多样化文本数据)训练,具备文本理解、内容生成、语言翻译、智能问答、代码编写等核心能力的大型人工智能模型,是RAG、Agent等大模型应用体系的核心基础与能力底座,也是检索系统的核心推理支撑。优势:通用能力强、适配场景广;劣势:训练成本高、易产生幻觉、对低算力设备不友好。 |
| GPT大语言模型 | Generative Pre-trained Transformer | GPT | 由OpenAI研发的基于Transformer架构的LLM,通过预训练和微调实现高质量文本生成。优势:生成能力强、生态完善、应用场景丰富;劣势:闭源、使用成本高、知识存在时效性、幻觉问题较明显。 |
| Claude大语言模型 | Claude Large Language Model | Claude | 由Anthropic研发的LLM。优势:长文本处理能力突出、高安全性、对齐能力强、幻觉概率低于GPT;劣势:闭源、生成速度略慢、部分专业场景适配性不如专用模型。 |
| Qwen大语言模型 | Qwen Large Language Model | Qwen | 由阿里云研发的开源LLM。优势:开源可二次开发、支持多语言处理、高效推理、适配中文场景优化、成本较低;劣势:高端能力略逊于GPT和Claude、部分复杂任务表现一般。 |
| DeepSeek大语言模型 | DeepSeek Large Language Model | DeepSeek | 由深度求索研发的LLM。优势:代码生成、数学推理领域表现突出、提供开源和闭源多种版本、适配科研和企业场景;劣势:生态完善度不足、多模态能力较弱。 |
| Gemini大语言模型 | Gemini Large Language Model | Gemini | 由Google研发的多模态LLM。优势:多模态能力强(支持文本、图像、音频等)、通用能力突出、与Google生态深度融合;劣势:闭源、部分场景生成效果不稳定、中文适配性一般。 |
| Grok大语言模型 | Grok Large Language Model | Grok | 由X(原Twitter)研发的LLM。优势:实时信息获取能力强、对话交互自然、适配社交媒体场景;劣势:闭源、专业能力较弱、应用场景较单一。 |
| 词元/标记 | Token | - | 自然语言被模型处理时的最小语义单位,可是字、词、子词,模型的输入输出均以Token为单位计量。 |
| 参数 | Parameter | - | 模型学到的“知识”,是神经网络中的可调数值,通过训练数据不断优化。参数越多,模型表达能力越强,但也更易过拟合。当前趋势是:高质量数据+适度规模>盲目堆参数。 |
| 算力 | Computing Power | - | 支撑大模型训练、推理的计算能力,主要由GPU/TPU等算力芯片提供,算力规模决定模型训练效率和落地可行性。 |
| 开源 | Open Source | - | 模型的代码、权重、训练数据等相关资源向公众开放,允许开发者二次开发、修改和使用。 |
| 闭源 | Closed Source | - | 模型的核心代码、权重等资源由开发方掌控,仅对外开放调用接口,不提供底层核心资源。 |
| 涌现/涌现能力 | Emergence/Emergent Ability | - | 量变引发质变的关键现象,大模型在参数规模达到临界值后,自发产生的未经过显式训练的新能力,如多步推理、代码生成、创意写作。这解释了为何“更大模型更聪明”——智能不是线性增长,而是阶梯式跃迁。 |
| 泛化/泛化能力 | Generalization/Generalization Ability | - | 模型将训练集中学到的知识,应用到未见过的新数据、新场景中的能力,泛化能力越强模型的实际应用价值越高。 |
| 位置编码 | Positional Encoding | - | 为解决Transformer架构无法感知文本语序的问题,给每个Token添加的位置信息,使模型能理解文本的顺序语义。 |
| 嵌入层 | Embedding Layer | - | 大模型的基础层,将离散的Token转换为连续的低维稠密向量,让模型能对自然语言进行数值化计算和语义理解。 |
| 人工智能 | Artificial Intelligence | AI | 研究、开发用于模拟、延伸和扩展人的智能的理论、方法、技术及应用系统的一门技术科学,是大模型、机器学习、深度学习等技术的统称。 |
| 机器学习 | Machine Learning | ML | 人工智能的一个分支,研究计算机如何在没有明确编程的情况下学习和改进,通过算法从数据中提取规律,实现自主优化,是大模型训练的核心基础。 |
| 深度学习 | Deep Learning | DL | 机器学习的一个分支,基于多层神经网络构建模型,能自动学习数据的深层特征,无需人工手动特征工程,是大模型、CNN、RNN等技术的核心支撑。 |
| 神经网络 | Neural Network | NN | 模拟人脑神经元结构构建的计算模型,由输入层、隐藏层、输出层组成,通过神经元之间的连接权重传递信息,是深度学习和大模型的核心架构基础。 |
| 监督学习 | Supervised Learning | - | 机器学习的一种范式,使用带标注的训练数据(输入+对应标签)训练模型,让模型学习输入与标签之间的映射关系,适用于分类、回归等任务。 |
| 无监督学习 | Unsupervised Learning | - | 机器学习的一种范式,使用无标注的训练数据,让模型自主挖掘数据中的内在规律和特征,适用于聚类、降维等任务,是大模型预训练的核心方式之一。 |
| 强化学习 | Reinforcement Learning | RL | 机器学习的一种范式,通过“智能体与环境交互”学习,智能体通过执行动作获得奖励或惩罚,不断优化策略以最大化累积奖励,RLHF是其在大模型中的典型应用。 |
| 迁移学习 | Transfer Learning | - | 将一个任务中训练得到的模型知识,迁移到另一个相关任务中,减少新任务的训练成本,提升模型性能,大模型的“预训练+微调”模式本质就是迁移学习。 |
| 通用人工智能 | Artificial General Intelligence | AGI | 具备与人类同等或超越人类的通用智能,能理解、学习人类所有任务和能力的人工智能,区别于当前的专用AI(如LLM),是人工智能领域的终极目标之一。 |
| 复杂系统 | Complex Systems | - | AI的本质是复杂系统,由大量相互作用的组件(如神经元)构成,整体行为无法从单个组件推导。大模型拥有数百亿参数,其输出是无数非线性交互的结果——微小输入变化可能导致巨大输出差异(“蝴蝶效应”),交通、金融、生态系统同理。 |
| 世界模型 | World Models | - | 理想中的“AI常识库”,指AI对物理规律、社会规范、因果关系的内在理解。当前大模型并无真正世界模型,仅通过统计关联模拟现实。例如,它知道“火会烧伤人”,但不理解“热传导”原理。构建可靠世界模型,是通往AGI的核心挑战。 |
| 基础模型 | Foundation Model | - | AI时代的“操作系统”,在海量数据上预训练的通用模型(如LLM),可作为各类下游应用的基础。通过微调或提示工程,适配具体场景。它的出现标志着AI开发范式从“为每个任务训练一个模型”转向“一个大模型服务千行百业”。 |
二、核心架构类
| 中文术语 | 英文术语 | 英文缩写 | 说明 |
|---|---|---|---|
| Transformer架构 | Transformer Architecture | - | 基于自注意力机制的深度学习架构,采用编码器-解码器结构,是目前绝大多数大语言模型的核心基础架构,解决了传统RNN难以处理长文本的问题。 |
| 注意力机制 | Attention Mechanism | - | 让模型在处理文本时,能自动关注与当前内容相关的关键部分,分配不同的注意力权重,提升语义理解的准确性,是Transformer架构的核心。 |
| 自注意力机制 | Self-Attention Mechanism | - | 注意力机制的核心形式,让文本序列中的每个Token都能与序列内其他所有Token计算注意力权重,捕捉文本内部的语义关联,是Transformer处理长文本的关键。 |
| 多头注意力 | Multi-Head Attention | - | 将自注意力机制拆分为多个独立的注意力头,每个头捕捉文本不同维度的语义信息,最后拼接结果,提升模型的语义捕捉能力。 |
| 混合专家模型 | Mixture of Experts | MoE | 将模型拆分为多个独立的“专家子模型”,输入数据仅由匹配的少数专家子模型处理,兼顾模型能力和训练/推理效率,是大模型规模扩展的核心技术之一。 |
| 卷积神经网络 | Convolutional Neural Network | CNN | 深度学习架构之一,擅长处理网格结构数据(如图像),通过卷积操作提取局部特征,广泛应用于计算机视觉(CV)领域,部分多模态大模型会融合CNN提取图像特征。 |
| 循环神经网络 | Recurrent Neural Network | RNN | 深度学习架构之一,具备时序记忆能力,可处理序列数据(如文本、音频),但存在梯度消失/爆炸问题,难以处理长文本,后被Transformer替代。 |
| 长短期记忆网络 | Long Short-Term Memory | LSTM | RNN的改进版本,通过门控机制(输入门、遗忘门、输出门)解决RNN梯度消失/爆炸问题,能捕捉长序列中的长期依赖,适用于文本生成、语音识别等场景。 |
| 门控循环单元 | Gated Recurrent Unit | GRU | LSTM的简化版本,合并了输入门和遗忘门,结构更简洁、计算效率更高,在时序任务中表现接近LSTM,适用于算力有限的场景。 |
| 生成对抗网络 | Generative Adversarial Network | GAN | 由生成器和判别器组成的生成模型,通过两者对抗训练提升生成效果,广泛应用于图像生成、文本生成等场景,与LLM形成互补。 |
| 支持向量机 | Support Vector Machine | SVM | 传统机器学习算法,通过寻找最优分类超平面实现分类任务,在小样本、高维数据场景中表现优秀,目前逐渐被深度学习模型替代,但仍用于部分简单分类场景。 |
| 扩散模型 | Diffusion Model | - | 生成模型的一种,通过逐步向数据中添加噪声,再反向学习去噪过程,实现高质量内容生成,广泛应用于图像生成、文本生成等场景,与LLM结合可提升生成效果。 |
| 词嵌入 | Word Embeddings | - | 词语的数字身份证,将词汇映射为低维向量,语义相近的词(如“国王”-“王后”)在向量空间中距离更近。Word2Vec、GloVe等模型通过分析词语共现模式学习嵌入,为NLP提供数学基础。 |
| Token分词 | Tokenization | - | 文本的最小处理单元,将句子切分为Token(词、子词或字符)。现代模型多用BPE(字节对编码),能高效处理未知词和多语言,是大模型处理文本的第一步。 |
| 上下文长度 | Context Length | - | AI的“短期记忆”容量,指单次推理能处理的最大Token数。从早期2K到如今200K+(如Claude-4),更长上下文支持分析整本书、长对话记忆,但代价是更高计算开销,扩展上下文仍是研究热点。 |
三、训练技术类
| 中文术语 | 英文术语 | 英文缩写 | 说明 |
|---|---|---|---|
| 预训练 | Pre-training | - | 打基础阶段,在海量无标注文本上自监督学习(如预测下一个词),模型由此掌握语言规律、世界知识。BERT、GPT均先预训练,再微调,是大模型具备通用能力的核心步骤。 |
| 微调 | Fine-tuning | - | 专业化训练,用少量标注数据调整预训练模型,使其适应特定任务(如医疗问答)。相比从头训练,微调成本低、效果好,是企业落地主流方式,属于迁移学习的典型应用。 |
| 指令微调 | Instruction Fine-Tuning | - | 以自然语言指令的形式构建训练数据,让模型学习理解各类指令并完成对应任务,提升模型的指令遵循能力和通用交互能力。 |
| 自监督学习 | Self-Supervised Learning | SSL | 无需人工标注标签,通过从数据本身构造监督信号进行训练的方式,是大模型预训练阶段的核心学习方法。 |
| 思维链 | Chain-of-Thought | CoT | 让AI“展示解题过程”,要求模型逐步推理(如“首先…其次…因此…”),显著提升复杂数学、逻辑问题的准确率,模拟人类思考,增强可解释性,是Agent实现复杂决策的核心技术之一。 |
| 少样本学习 | Few-shot Learning | - | 举一反三的能力,LLM能通过提示中的几个示例快速理解新任务,无需修改参数。例如,给两三个翻译例子,就能翻译新句子,降低使用门槛,推动AI普及。 |
| 零样本学习 | Zero-shot Learning | - | 模型在未见过任何任务示例的情况下,仅通过自然语言描述就能完成新任务的能力,是大模型通用能力的重要体现。 |
| 缩放定律 | Scaling Law | - | 揭示大模型的性能与参数规模、训练数据量、算力投入之间的量化关系,为大模型的规模设计提供理论依据,也称为规模法则。 |
| 温度系数 | Temperature | - | 模型推理阶段的核心参数,用于调节输出结果的随机性,系数越高输出越随机,越低输出越确定、保守。 |
| 错误案例 | Error Case | - | 模型输出结果错误、不符合需求或存在问题的案例,提取后经人工修正可作为模型的学习数据,是模型迭代优化的重要素材。 |
| 模型迭代学习 | Model Iterative Learning | - | 通过提取错误案例经人工修正后沉淀,将修正后的案例部分供给大模型继续训练学习,实现模型能力的持续优化提升。 |
| 人类反馈强化学习 | Reinforcement Learning from Human Feedback | RLHF | 教AI“做人”的核心技术,先训练奖励模型预测人类偏好,再用强化学习优化LLM以最大化 |
四、应用领域类
| 中文术语 | 英文术语 | 英文缩写 | 说明 |
|---|---|---|---|
| 自然语言处理 | Natural Language Processing | NLP | 人工智能的重要分支,专注于让计算机理解、处理和生成人类自然语言,涵盖文本分析、翻译、问答等核心场景,是LLM的核心应用领域。 |
| 计算机视觉 | Computer Vision | CV | 让计算机具备“看见”和理解图像、视频的能力,涵盖图像识别、目标检测、图像生成等场景,多模态大模型的核心组成部分。 |
| 语音识别 | Speech Recognition | ASR | 将人类语音信号转换为文本的技术,广泛应用于语音助手、实时字幕、语音输入等场景,是人机语音交互的核心支撑。 |
| 文本转语音 | Text-to-Speech | TTS | 将文本内容转换为自然、流畅的人类语音的技术,适用于语音播报、有声读物、语音助手等场景。 |
| 光学字符识别 | Optical Character Recognition | OCR | 将图像中的文字(如扫描件、照片中的文字)识别并转换为可编辑文本的技术,广泛应用于文档数字化、票据识别等场景。 |
| 命名实体识别 | Named Entity Recognition | NER | NLP中的核心任务,用于识别文本中的命名实体(如人名、地名、机构名、时间等),为文本分析、信息提取提供基础。 |
| 聊天机器人 | Chatbot | - | 基于AI技术实现与人自然对话的系统,可分为规则型、智能型,广泛应用于客户服务、智能助手等场景,LLM极大提升了其对话能力。 |
| 人工智能生成内容 | Artificial Intelligence Generated Content | AIGC | 利用人工智能技术生成文本、图像、音频、视频等各类内容的技术,核心依托LLM、扩散模型等,是当前AI应用的核心热点。 |
| 通用人工智能 | Artificial General Intelligence | AGI | 具备与人类同等或超越人类的通用智能,能理解、学习人类所有任务和能力的人工智能,区别于当前的专用AI(如LLM),是人工智能领域的终极目标之一。 |
| 提示工程 | Prompt Engineering | - | 与AI高效沟通的艺术,通过设计指令(如“用表格总结”“分三点回答”)引导模型输出,好的提示=明确任务+背景信息+输出格式+示例。 |
| 思维链 | Chain-of-Thought | CoT | 让AI“展示解题过程”,要求模型逐步推理(如“首先…其次…因此…”),显著提升复杂数学、逻辑问题的准确率,模拟人类思考,增强可解释性。 |
| 检索增强生成 | Retrieval-Augmented Generation | RAG | 给AI接入“外挂大脑”,用户提问时,先从知识库检索相关信息,再让LLM基于检索结果生成答案,可解决幻觉、知识陈旧问题,是企业落地的首选方案。 |
| 向量数据库 | Vector Database | - | AI的“长期记忆库”,专门存储和检索高维向量(如文本嵌入),支持语义搜索(如“找类似‘客户投诉处理流程’的文档”),Pinecone、Milvus是典型代表,是RAG的核心基础设施。 |
| AI智能体 | AI Agent | - | 从问答到行动的跃迁,能感知环境、制定计划、调用工具、执行任务的自主系统。例如,自动订机票的Agent会查航班、比价、填表、支付,代表AI从“被动响应”走向“主动做事”。 |
五、硬件与计算类
| 中文术语 | 英文术语 | 英文缩写 | 说明 |
|---|---|---|---|
| 图形处理器 | Graphics Processing Unit | GPU | 核心算力芯片,具备强大的并行计算能力,是大模型训练、推理的核心硬件支撑,广泛应用于AI、游戏、图形渲染等领域。 |
| 张量处理单元 | Tensor Processing Unit | TPU | 由Google研发的专用AI芯片,专门针对张量运算优化,适用于大模型训练和推理,效率高于普通GPU,与Google生态深度融合。 |
| 现场可编程门阵列 | Field-Programmable Gate Array | FPGA | 可编程的专用集成电路,可根据需求灵活配置硬件逻辑,兼顾算力和灵活性,适用于AI推理、边缘计算等场景。 |
| 专用集成电路 | Application-Specific Integrated Circuit | ASIC | 为特定任务(如AI推理、加密计算)专门设计的集成电路,算力高、功耗低,但灵活性差,无法后期修改配置。 |
| 边缘计算 | Edge Computing | - | 将计算任务从云端迁移到终端设备(如手机、物联网设备)边缘,减少网络延迟、降低云端压力,适用于实时AI推理、隐私保护等场景。 |
| 联邦学习 | Federated Learning | - | 分布式学习技术,多个参与方在不共享原始数据的前提下,共同训练模型,保护数据隐私,是AI隐私保护的核心技术之一。 |
| 云端人工智能 | Cloud AI | - | 将AI计算任务部署在云端服务器,依托云端强大的算力支撑大模型训练和推理,用户通过网络调用AI服务,无需本地具备高性能硬件。 |
六、性能评估类
| 中文术语 | 英文术语 | 英文缩写 | 说明 |
|---|---|---|---|
| 双语评估替换分数 | Bilingual Evaluation Understudy | BLEU | 用于评估机器翻译、文本生成质量的指标,通过对比模型输出与参考文本的相似度打分,分数越高,生成质量越接近人类水平。 |
| 困惑度 | Perplexity | - | 语言模型的“预测准确率”,值越低越好。困惑度为10,表示模型平均在10个词中选对下一个,主要用于监控模型训练过程。 |
| 轮次 | Epoch | - | 模型训练的基本单位,指训练数据集中的所有样本被模型完整训练一次的过程,轮次越多,模型训练越充分,但也可能导致过拟合。 |
| 学习率 | Learning Rate | - | 模型训练的核心超参数,控制模型参数更新的步长,学习率过高易导致训练不稳定,过低则训练速度慢、难以收敛。 |
| 机器学习运维 | Machine Learning Operations | MLOps | 将DevOps理念应用于机器学习领域,实现模型训练、部署、监控、迭代的自动化流程,提升模型落地效率和稳定性。 |
| 过拟合 | Overfitting | - | 模型在训练集上表现极好,但在未见过的测试集上表现较差,本质是模型过度学习了训练集中的噪声和细节,泛化能力差。 |
| 欠拟合 | Underfitting | - | 模型未能充分学习训练数据中的规律,在训练集和测试集上表现都较差,通常由模型复杂度不足、训练轮次不够导致。 |
| 模型压缩 | Model Compression | - | 通过量化、剪枝、知识蒸馏等技术,减少模型的参数数量和内存占用,提升推理速度,使大模型能适配低算力设备。 |
| 量化 | Quantization | - | 模型瘦身术,将32位浮点参数转为8位整数,大幅减少内存占用和推理延迟,使大模型能在手机、边缘设备运行。 |
| 剪枝 | Pruning | - | 模型压缩技术之一,移除模型中权重较小、对模型性能影响不大的参数和神经元,减少模型体积,提升推理效率。 |
| 知识蒸馏 | Knowledge Distillation | - | 将复杂的“教师模型”的知识迁移到简单的“学生模型”中,使学生模型在保持接近教师模型性能的同时,体积更小、推理更快。 |
| 基准测试 | Benchmarks | - | AI的“高考”,通过标准化测试集评估模型能力,常见的有MMLU(知识)、HumanEval(编程)、HellaSwag(常识),各厂商发布新模型必晒benchmark成绩。 |
| 鲁棒性 | Robustness | - | 模型的抗干扰能力,面对错别字、语法错误、对抗攻击时仍能稳定输出,真实世界充满噪声,鲁棒性决定AI是否可用。 |
| 延迟 | Latency | - | 模型的响应速度,指从输入指令到输出结果的时间,对话系统需<1秒,实时翻译要求更低,受模型大小、硬件、网络等因素影响。 |
七、伦理安全类
| 中文术语 | 英文术语 | 英文缩写 | 说明 |
|---|---|---|---|
| 幻觉 | Hallucination | - | AI的“一本正经胡说八道”,指生成看似合理但虚假的信息,源于统计模型的本质——它在“补全概率最高”的文本,而非“陈述事实”,RAG和事实核查是主要缓解手段。 |
| 偏见 | Bias | - | AI放大社会不公,训练数据中包含的性别、种族等偏见,会导致模型输出歧视性内容,例如将“护士”默认关联女性,需通过数据清洗、公平性约束缓解。 |
| 对齐 | Alignment | - | 让AI与人类价值观一致,确保其行为有益、诚实、无害,RLHF、宪法AI等技术为此服务,是AGI安全的核心议题。 |
| 红队测试 | Red Teaming | - | 主动“找茬”,通过越狱、诱导等方式测试AI的安全漏洞,提前发现并修复问题,类似网络安全中的渗透测试。 |
| 可解释性AI | Explainable AI | XAI | 打开AI的“黑箱”,用SHAP、LIME等技术解释模型决策的原因,对医疗、金融等高风险领域至关重要,提升AI的可信度。 |
| 数据隐私 | Data Privacy | - | 保护用户信息,防止训练数据泄露(如记住用户电话号码)、推理过程暴露隐私,差分隐私、联邦学习是保障数据隐私的关键技术。 |
八、其他类
| 中文术语 | 英文术语 | 英文缩写 | 说明 |
|---|---|---|---|
| 应用程序接口 | Application Programming Interface | API | 不同软件之间的交互接口,开发者可通过API调用大模型的能力(如文本生成、问答),快速集成AI功能到自身应用中。 |
| 软件开发工具包 | Software Development Kit | SDK | 为开发者提供的软件开发工具集合,包含API、示例代码、文档等,简化AI功能的集成和开发过程。 |
| 基准测试 | Benchmark | - | 用于评估AI模型性能的标准化测试集或方法,与“基准测试(Benchmarks)”含义一致,是衡量模型能力的重要参考。 |
| 真实标签/真值 | Ground Truth | - | 数据集中的真实答案或标签,用于训练模型、评估模型性能,是判断模型输出是否准确的核心参考标准。 |
| 流水线/流程 | Pipeline | - | 将AI任务拆分为多个连续的步骤(如数据预处理、模型推理、结果后处理),形成自动化流程,提升任务执行效率和稳定性。 |
| 潜在空间 | Latent Space | - | 数据在经过模型编码后的低维向量空间,其中相似的输入会映射到相近的向量,是生成模型、聚类等任务的核心基础。 |
更多推荐
所有评论(0)