上一篇文章:AI大模型与AI智能体专业术语-CSDN博客


接上一篇文章继续汇总AI大模型及AI智能体专业术语。

四、训练与优化

术语(中文)

术语(英文)

释义

Pre-training(预训练)

Pre-training

在海量无标注数据上训练基础模型,学习通用语言与世界知识。

Fine-tuning(微调)

Fine-tuning

在预训练模型上用特定任务数据继续训练,使其适配下游场景。

SFT(监督微调)

Supervised Fine-Tuning

用人工标注的 (输入, 输出) 对对模型进行有监督训练。

RLHF(人类反馈强化学习)

RLHF

通过人类偏好排序训练奖励模型,再用强化学习优化大模型。

DPO(直接偏好优化)

Direct Preference Optimization

无需训练奖励模型,直接基于偏好数据优化策略,RLHF 的简化版。

PPO(近端策略优化)

PPO

强化学习中常用的策略梯度算法,RLHF 中常用。

Reward Model(奖励模型)

Reward Model

在 RLHF 中用于打分人类偏好质量的模型。

LoRA(低秩适配)

Low-Rank Adaptation

冻结原参数、仅训练低秩矩阵的轻量化微调方法。

QLoRA

Quantized LoRA

在 4-bit 量化模型上做 LoRA 微调,进一步降低显存。

PEFT(参数高效微调)

Parameter-Efficient Fine-Tuning

包括 LoRA、Adapter、Prefix-Tuning 等仅微调少量参数的方法。

Continue Pre-training(继续预训练)

Continue Pre-training

在已有基座上用领域语料继续预训练,注入行业知识。

Instruction Tuning(指令微调)

Instruction Tuning

用指令-响应对训练模型遵循自然语言指令的能力。

Few-shot/Zero-shot(少样本/零样本)

Few-shot/Zero-shot

不训练或仅给少量示例就让模型完成任务的推理方式。

In-context Learning(上下文学习)

In-context Learning

模型从 Prompt 中的示例里学习规律,无需更新参数。

Prompt Engineering(提示工程)

Prompt Engineering

通过设计 Prompt 提升模型表现的技术,包含角色设定、示例、约束等。

五、评估与对齐

术语(中文)

术语(英文)

释义

Hallucination(幻觉)

Hallucination

模型生成看似合理但实际错误或无中生有的内容,是大模型核心风险之一。

Alignment(对齐)

Alignment

让模型行为符合人类意图、价值观和安全的系列技术与研究。

AI Safety(AI 安全)

AI Safety

防止模型被滥用、产生有害输出的研究领域。

Guardrail(护栏)

Guardrail

对模型输入/输出进行过滤、拦截或重写的安全机制。

Red Teaming(红队测试)

Red Teaming

模拟恶意输入以评估模型安全性的对抗性测试。

Jailbreak(越狱)

Jailbreak

通过特殊 Prompt 绕过模型安全限制,诱导有害输出。

Bias(偏见)

Bias

模型在性别、种族、文化等维度上表现出的不公平倾向。

Benchmark(基准测试)

Benchmark

用于评估模型能力的标准化测试集,如 MMLU、GSM8K、HumanEval。

MMLU

Massive Multitask Language Understanding

涵盖 57 个学科的多选问答基准,衡量模型知识广度。

HumanEval

HumanEval

评估代码生成能力的经典基准。

GSM8K

Grade School Math 8K

小学数学应用题基准,衡量数学推理能力。

TruthfulQA

TruthfulQA

评估模型回答真实性、避免幻觉的基准。

Eval Pipeline(评估流水线)

Eval Pipeline

自动化跑分、数据集管理、结果对比的评估体系。

BLEU/ROUGE

BLEU/ROUGE

机器翻译与摘要任务的传统自动评估指标。

六、工程与部署

术语(中文)

术语(英文)

释义

Inference(推理)

Inference

模型在生产环境对新输入进行预测的过程。

Throughput(吞吐量)

Throughput

单位时间内模型能处理的请求数(Tokens/s 或 QPS)。

Latency(延迟)

Latency

从发出请求到收到首个 Token 或完整响应的耗时。

Streaming(流式输出)

Streaming

模型边生成边返回结果(SSE/WebSocket),提升首字响应速度。

KV Cache

Key-Value Cache

推理时缓存注意力中的 K/V,避免重复计算,加速生成。

PagedAttention

PagedAttention

vLLM 提出的显存分页管理技术,大幅提升吞吐。

vLLM

vLLM

高性能开源推理引擎,支持 PagedAttention、动态批处理。

TGI(文本生成推理)

Text Generation Inference

HuggingFace 推出的生产级推理服务框架。

Triton Inference Server

Triton Inference Server

NVIDIA 的多框架模型服务化部署平台。

ONNX/TensorRT

ONNX/TensorRT

跨框架模型表示格式与 NVIDIA 高性能推理优化器。

GPU/TPU/NPU

GPU/TPU/NPU

分别对应通用 GPU、谷歌 TPU、专用 AI 加速芯片。

Fine-tuning Framework(微调框架)

Fine-tuning Framework

如 Transformers、PEFT、DeepSpeed、MS-Swift、Llama-Factory。

Distributed Training(分布式训练)

Distributed Training

数据并行、张量并行、流水线并行等多卡/多机训练方案。

DeepSpeed/Megatron

DeepSpeed/Megatron

主流的分布式训练与张量并行框架。

ZeRO

Zero Redundancy Optimizer

DeepSpeed 提出的优化器状态分片策略,显著降低显存。

MLOps/LLMOps

MLOps/LLMOps

面向机器学习/大模型全生命周期的工程化运维体系。

Prompt Management(提示管理)

Prompt Management

对 Prompt 进行版本化、评测、AB 实验的平台能力。

Observability(可观测性)

Observability

对模型调用、Token 消耗、延迟、错误率等进行监控与追踪。

API Gateway(API 网关)

API Gateway

统一鉴权、限流、路由到后端模型服务的入口层。

更多推荐