AI大模型与AI智能体专业术语
上一篇文章:AI大模型与AI智能体专业术语-CSDN博客
接上一篇文章继续汇总AI大模型及AI智能体专业术语。
四、训练与优化
| 术语(中文) | 术语(英文) | 释义 |
| Pre-training(预训练) | Pre-training | 在海量无标注数据上训练基础模型,学习通用语言与世界知识。 |
| Fine-tuning(微调) | Fine-tuning | 在预训练模型上用特定任务数据继续训练,使其适配下游场景。 |
| SFT(监督微调) | Supervised Fine-Tuning | 用人工标注的 (输入, 输出) 对对模型进行有监督训练。 |
| RLHF(人类反馈强化学习) | RLHF | 通过人类偏好排序训练奖励模型,再用强化学习优化大模型。 |
| DPO(直接偏好优化) | Direct Preference Optimization | 无需训练奖励模型,直接基于偏好数据优化策略,RLHF 的简化版。 |
| PPO(近端策略优化) | PPO | 强化学习中常用的策略梯度算法,RLHF 中常用。 |
| Reward Model(奖励模型) | Reward Model | 在 RLHF 中用于打分人类偏好质量的模型。 |
| LoRA(低秩适配) | Low-Rank Adaptation | 冻结原参数、仅训练低秩矩阵的轻量化微调方法。 |
| QLoRA | Quantized LoRA | 在 4-bit 量化模型上做 LoRA 微调,进一步降低显存。 |
| PEFT(参数高效微调) | Parameter-Efficient Fine-Tuning | 包括 LoRA、Adapter、Prefix-Tuning 等仅微调少量参数的方法。 |
| Continue Pre-training(继续预训练) | Continue Pre-training | 在已有基座上用领域语料继续预训练,注入行业知识。 |
| Instruction Tuning(指令微调) | Instruction Tuning | 用指令-响应对训练模型遵循自然语言指令的能力。 |
| Few-shot/Zero-shot(少样本/零样本) | Few-shot/Zero-shot | 不训练或仅给少量示例就让模型完成任务的推理方式。 |
| In-context Learning(上下文学习) | In-context Learning | 模型从 Prompt 中的示例里学习规律,无需更新参数。 |
| Prompt Engineering(提示工程) | Prompt Engineering | 通过设计 Prompt 提升模型表现的技术,包含角色设定、示例、约束等。 |
五、评估与对齐
| 术语(中文) | 术语(英文) | 释义 |
| Hallucination(幻觉) | Hallucination | 模型生成看似合理但实际错误或无中生有的内容,是大模型核心风险之一。 |
| Alignment(对齐) | Alignment | 让模型行为符合人类意图、价值观和安全的系列技术与研究。 |
| AI Safety(AI 安全) | AI Safety | 防止模型被滥用、产生有害输出的研究领域。 |
| Guardrail(护栏) | Guardrail | 对模型输入/输出进行过滤、拦截或重写的安全机制。 |
| Red Teaming(红队测试) | Red Teaming | 模拟恶意输入以评估模型安全性的对抗性测试。 |
| Jailbreak(越狱) | Jailbreak | 通过特殊 Prompt 绕过模型安全限制,诱导有害输出。 |
| Bias(偏见) | Bias | 模型在性别、种族、文化等维度上表现出的不公平倾向。 |
| Benchmark(基准测试) | Benchmark | 用于评估模型能力的标准化测试集,如 MMLU、GSM8K、HumanEval。 |
| MMLU | Massive Multitask Language Understanding | 涵盖 57 个学科的多选问答基准,衡量模型知识广度。 |
| HumanEval | HumanEval | 评估代码生成能力的经典基准。 |
| GSM8K | Grade School Math 8K | 小学数学应用题基准,衡量数学推理能力。 |
| TruthfulQA | TruthfulQA | 评估模型回答真实性、避免幻觉的基准。 |
| Eval Pipeline(评估流水线) | Eval Pipeline | 自动化跑分、数据集管理、结果对比的评估体系。 |
| BLEU/ROUGE | BLEU/ROUGE | 机器翻译与摘要任务的传统自动评估指标。 |
六、工程与部署
| 术语(中文) | 术语(英文) | 释义 |
| Inference(推理) | Inference | 模型在生产环境对新输入进行预测的过程。 |
| Throughput(吞吐量) | Throughput | 单位时间内模型能处理的请求数(Tokens/s 或 QPS)。 |
| Latency(延迟) | Latency | 从发出请求到收到首个 Token 或完整响应的耗时。 |
| Streaming(流式输出) | Streaming | 模型边生成边返回结果(SSE/WebSocket),提升首字响应速度。 |
| KV Cache | Key-Value Cache | 推理时缓存注意力中的 K/V,避免重复计算,加速生成。 |
| PagedAttention | PagedAttention | vLLM 提出的显存分页管理技术,大幅提升吞吐。 |
| vLLM | vLLM | 高性能开源推理引擎,支持 PagedAttention、动态批处理。 |
| TGI(文本生成推理) | Text Generation Inference | HuggingFace 推出的生产级推理服务框架。 |
| Triton Inference Server | Triton Inference Server | NVIDIA 的多框架模型服务化部署平台。 |
| ONNX/TensorRT | ONNX/TensorRT | 跨框架模型表示格式与 NVIDIA 高性能推理优化器。 |
| GPU/TPU/NPU | GPU/TPU/NPU | 分别对应通用 GPU、谷歌 TPU、专用 AI 加速芯片。 |
| Fine-tuning Framework(微调框架) | Fine-tuning Framework | 如 Transformers、PEFT、DeepSpeed、MS-Swift、Llama-Factory。 |
| Distributed Training(分布式训练) | Distributed Training | 数据并行、张量并行、流水线并行等多卡/多机训练方案。 |
| DeepSpeed/Megatron | DeepSpeed/Megatron | 主流的分布式训练与张量并行框架。 |
| ZeRO | Zero Redundancy Optimizer | DeepSpeed 提出的优化器状态分片策略,显著降低显存。 |
| MLOps/LLMOps | MLOps/LLMOps | 面向机器学习/大模型全生命周期的工程化运维体系。 |
| Prompt Management(提示管理) | Prompt Management | 对 Prompt 进行版本化、评测、AB 实验的平台能力。 |
| Observability(可观测性) | Observability | 对模型调用、Token 消耗、延迟、错误率等进行监控与追踪。 |
| API Gateway(API 网关) | API Gateway | 统一鉴权、限流、路由到后端模型服务的入口层。 |
更多推荐

所有评论(0)