AI大模型高频面试题

📌 覆盖范围:大模型基础、预训练、微调、提示词、RAG、Agent、工程部署、幻觉问题
🎯 适用岗位:算法工程师、大模型应用开发工程师面试复习## 一、基础概念

📑 目录

1. Transformer核心结构是什么

Transformer 由编码器(Encoder)解码器(Decoder) 组成,核心是 自注意力机制(Self-Attention)

  • Encoder:负责理解输入文本;
  • Decoder:基于上文生成输出文本。

💡 大语言模型(如 GPT 系列)大多只用 Decoder 架构。

2. 什么是自注意力机制,作用是什么

自注意力机制可以计算文本中每个 token 与其他 token 之间的关联权重,从而捕捉上下文依赖关系,让模型理解长距离语义。

🔍 多头注意力:从多个角度学习语义特征,进一步增强模型的表达能力。

3. 大模型的参数量代表什么,参数量越大一定越好吗

参数量代表模型可学习的参数规模。参数量越大,拟合能力越强,但也会带来一系列问题:

  • ⚠️ 推理速度变慢
  • ⚠️ 显存占用高
  • ⚠️ 容易过拟合
  • ⚠️ 推理成本上升

💡 结论:参数量不是越大越好,需要结合数据规模、微调策略和业务场景综合考量。

二、预训练类

1. 大模型预训练目标是什么

自回归语言建模为目标,给定上文预测下一个 token,从海量文本中学习语法、知识、逻辑与常识。

2. 预训练阶段会遇到哪些问题

  • 训练数据噪声大,存在错误、偏见;
  • 长文本训练压力大;
  • 算力消耗巨大;
  • 模型学到知识混杂,无法直接对齐人类意图。

三、微调对齐类

1. SFT、RLHF、DPO分别是什么

  1. SFT监督微调:使用高质量指令样本微调预训练模型,让模型学会遵循指令。
  2. RLHF人类反馈强化学习:SFT之后训练奖励模型,再用强化学习优化输出,对齐人类偏好。流程:SFT→训练RM奖励模型→PPO强化学习。
  3. DPO直接偏好优化:不需要单独训练奖励模型与PPO,直接用偏好数据做损失优化,实现对齐,实现简单,工程成本更低。

2. SFT数据集有什么要求

高质量、多样性、指令分布贴合业务场景;避免重复、错误样本;指令‑回答配对干净,数量不一定越多越好,质量优先。

3. LoRA原理,和全量微调对比

LoRA冻结大模型主干,仅在注意力层插入低秩矩阵,只训练少量参数。
对比:全量微调更新全部参数,效果好,但显存消耗巨大;LoRA参数量小、显存低,权重可合并、可插拔,适合行业场景微调。

四、提示词工程

1. CoT思维链原理与适用场景

让模型分步思考,把推理过程写出来,提升复杂推理能力,适合数学计算、逻辑推理类问题;简单问答场景收益不大。

2. Few‑shot、Zero‑shot区别

  • Zero‑shot:不给示例,直接提问;
  • Few‑shot:提示词内带上若干样例,引导模型模仿输出格式与逻辑。

3. 什么是提示词注入,如何防御

用户构造恶意提示词,绕过系统prompt篡改模型行为。防御:输入检测、系统提示加固、输出校验、隔离用户输入与系统指令。

五、RAG检索增强生成

1. RAG整体流程

文档解析→文本切分→向量化存入向量库→用户Query向量化→向量库检索相关片段→把检索片段+用户问题送入大模型→生成答案。

2. RAG相比微调优势

不需要改动模型权重;新增知识直接更新知识库,不用重新训练;可控性强,知识来源可溯源;成本远低于微调。

3. RAG常见问题和优化

问题:切分不合理、检索召回不准、噪声文档带入、上下文超限。
优化:文档合理分块、重排序Reranker、多路召回、过滤低质量片段、压缩上下文。

六、幻觉问题

1. 什么是大模型幻觉

模型输出内容看似通顺,但事实错误、编造事实、虚构引用。

2. 幻觉产生原因

训练数据错误缺失;模型是概率生成,不是数据库查询;上下文信息不足;输入模糊;模型为保证文本通顺编造内容。

3. 缓解幻觉方案

RAG引入真实参考材料;强制引用原文;降低模型创造性;增加事实校验;Prompt约束禁止编造未知内容;输出后事实校验。

七、Agent智能体

1. AI Agent核心组成

感知、记忆、规划推理、工具调用、执行闭环。能够自主拆解任务、调用外部工具迭代完成复杂任务。

2. ReAct工作流程

Thought思考 → Action行动 → Observation观测循环迭代,思考需要调用什么工具,拿到结果继续推理,直到任务完成。

八、工程部署推理

1. 什么是KV Cache,作用

缓存注意力计算的key、value,避免每一轮生成重复计算,大幅提升生成速度,降低算力开销。

2. 量化是什么,作用

把FP16/FP32权重转为INT8、INT4,降低显存占用,提升推理速度,会有少量精度损失。

3. 大模型推理常见优化手段

KV‑Cache、模型量化、批处理、连续批处理PagedAttention、模型蒸馏、张量并行、流水线并行。

九、面试复习小结

  • 初级:Transformer基础、SFT/LoRA、RAG流程、幻觉概念;
  • 中级:RLHF/DPO、向量检索优化、KV‑Cache、Agent基础;
  • 高级:训练微调调参、分布式训练、推理性能调优、业务场景方案设计。

更多推荐