面了 40+ 人后,我整理了 2026 大模型面试必考 12 题——第 7 题 90% 的人答不全(附答案+代码·建议收藏)
2026 年大厂 AI/LLM 岗位面试,无论你面的是算法岗还是工程岗,这 12 道题的出现概率超过 80%。我面试了 40+ 个候选人后,把每次必问、每次有人栽的题整理成了这份清单——从 Transformer 到 RAG,从 LoRA 到部署优化,每道题附带面试官追问方向、可运行代码和加分回答技巧。
速查表(面试前 3 分钟过一遍·建议截图保存)
| # | 问题 | 核心答案 | 面试频率 | 最易栽的坑 |
|---|---|---|---|---|
| Q1 | Transformer 自注意力计算过程? | QKV 投影→Score = QK^T/√dk→Softmax→加权 V | ⭐⭐⭐⭐⭐ | 不知道 √dk 为什么是 √dk |
| Q2 | 位置编码有几种? | 正弦/可学习/RoPE/ALiBi,2026 主流 RoPE | ⭐⭐⭐⭐ | 说不出 RoPE 为什么能外推 |
| Q3 | LoRA 原理? | 冻结原参数,旁路插入低秩矩阵 B×A | ⭐⭐⭐⭐⭐ | 把"低秩"解释成"参数少" |
| Q4 | 微调过拟合怎么办? | lr=1e-4~5e-4, 1-3 epoch, 数据质量>数量 | ⭐⭐⭐ | 只会调 lr 不会加 dropout |
| Q5 | RAG 完整流程? | 切分→Embedding→向量库→检索 Top-K→注入 Prompt→生成 | ⭐⭐⭐⭐⭐ | 跳过了检索策略(BM25+向量混合) |
| Q6 | RAG vs 长上下文? | RAG 低成本可溯源 | 长上下文全量但贵 | 2026 趋势融合 |
| Q7 | CoT vs ToT? | CoT 单线程推理 | ToT 多分支树搜索 | ⭐⭐⭐ |
| Q8 | Prompt 注入怎么防? | 输入过滤→Prompt 分隔→输出检测 | ⭐⭐⭐ | 只说了"加分隔符" |
| Q9 | 推理加速方案? | KV Cache/Flash Attention/量化/vLLM/TP | ⭐⭐⭐⭐ | 说不出 vLLM PagedAttention 原理 |
| Q10 | 生产级 LLM API 技术栈? | vLLM/SGLang+FastAPI+Nginx+Prometheus | ⭐⭐⭐ | 漏了监控和容器化 |
| Q11 | 大模型未来两年突破点? | Agent 自主执行·多模态融合·端侧推理·推理成本 | ⭐⭐⭐ | 只泛泛而谈,没有具体路线图 |
| Q12 | 关注的开源项目? | DeepSeek/Qwen3/vLLM·SGLang/AI Coding | ⭐⭐ | 只列名字不说为什么关注 |
五大模块关系图(面试知识体系)
一、Transformer 核心机制
Q1:请简述 Transformer 的自注意力机制计算过程
面试官想听到的三层回答:
- Q、K、V 三个矩阵的来源(输入 X 分别乘以 Wq、Wk、Wv)
- 注意力分数公式 + √dk 缩放的作用
- 多头注意力的意义
标准答案:
自注意力让序列中每个 token 关注所有其他 token。计算分四步:
- 输入 X 通过三个权重矩阵投影,得 Q(查询)、K(键)、V(值)
- Score = Q × K^T / √dk
- Softmax 归一化得到注意力权重
- 权重 × V 得到输出
📖 关于为什么是 QKV 而不是直接用 X、√dk 为什么是 √dk、多头到底"多"了什么——我在 Transformer 面试官视角——5 个必挖考点 中逐问拆解了面试官内心真实想法,建议配合阅读。
代码:
import torch
import torch.nn.functional as F
def scaled_dot_product_attention(Q, K, V, mask=None):
d_k = Q.size(-1)
scores = torch.matmul(Q, K.transpose(-2, -1)) / torch.sqrt(torch.tensor(d_k, dtype=torch.float32))
if mask is not None:
scores = scores.masked_fill(mask == 0, float('-inf'))
attention_weights = F.softmax(scores, dim=-1)
return torch.matmul(attention_weights, V), attention_weights
Q2:位置编码有哪几种?各有什么优缺点?
| 类型 | 原理 | 优点 | 缺点 |
|---|---|---|---|
| 正弦位置编码 | sin/cos 固定编码 | 可外推 | 表达能力有限 |
| 可学习位置编码 | 随机初始化训练更新 | 灵活 | 不能外推 |
| RoPE(LLaMA/Qwen) | 旋转矩阵编码相对位置 | 外推强·相对位置好 | 实现稍复杂 |
| ALiBi(Bloom) | 注意力分数加线性偏置 | 零额外参数 | 长文本弱 |
2026 标准结论: RoPE 是事实标准。LLaMA 3、Qwen 3、DeepSeek 全部用 RoPE。面试时只说"RoPE 好"不够——要说清楚为什么能外推(编码相对位置关系,而非绝对位置)。
📖 RoPE 外推原理的深度拆解,含代码验证,见 Transformer 面试官视角 考点五。
二、模型微调
Q3:LoRA 微调的原理是什么?
核心: 冻结原权重 W,旁路插入低秩矩阵 B×A(rank 通常 8-16),只训练 B 和 A。参数量减少 99%+。
from peft import LoraConfig, get_peft_model
from transformers import AutoModelForCausalLM
model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2.5-7B")
lora_config = LoraConfig(
r=16, lora_alpha=32,
target_modules=["q_proj","k_proj","v_proj","o_proj","gate_proj","up_proj","down_proj"],
lora_dropout=0.05, bias="none", task_type="CAUSAL_LM"
)
model = get_peft_model(model, lora_config)
model.print_trainable_parameters()
# trainable params: 8,388,608 || all params: 7,615,811,584 || trainable%: 0.1101
📖 LoRA 从 rank 选择、QLoRA 区别、训练实战到 7 个坑,完整拆解见 LoRA 微调 8 连问——面试官视角。
Q4:微调时遇到过拟合怎么办?
实战框架:
- LoRA lr = 1e-4~5e-4(比全参高 10-20×)
- SFT 阶段 1-3 epoch 足够
- 5000 条高质量数据 > 50000 条噪声数据
- 增加 lora_dropout 到 0.1 + warmup
- 验证集 Loss 不再下降就停
三、RAG(检索增强生成)
Q5:请解释 RAG 的完整工作流程
三步流程: 文档切分→Embedding→向量库 | Query→检索 Top-K | 注入 Prompt→LLM 生成
| 环节 | 选择 | 注意 |
|---|---|---|
| 文档切分 | 512 tokens, overlap 64 | 语义完整性优先 |
| Embedding | bge-large-zh / text2vec | 中文场景选中文模型 |
| 向量数据库 | Milvus/Chroma | 百万以下用 Chroma |
| 检索策略 | BM25 + 向量混合 | 纯向量对关键词不敏感 |
from langchain.text_splitter import RecursiveCharacterTextSplitter
from langchain.embeddings import HuggingFaceEmbeddings
from langchain.vectorstores import Chroma
splitter = RecursiveCharacterTextSplitter(chunk_size=512, chunk_overlap=64)
chunks = splitter.split_documents(documents)
embeddings = HuggingFaceEmbeddings(model_name="BAAI/bge-large-zh-v1.5")
vectorstore = Chroma.from_documents(chunks, embeddings)
retriever = vectorstore.as_retriever(search_kwargs={"k": 5})
Q6:RAG 和长上下文窗口(如 1M tokens)各有什么优劣势?
2026 面试超级高频题。
| 维度 | RAG | 长上下文 |
|---|---|---|
| 成本 | 低(只处理相关片段) | 高(全量 tokens) |
| 延迟 | 检索几 ms | 上下文越长越慢 |
| 准确率 | 取决于检索质量 | 不会漏但有"大海捞针" |
| 可控性 | 可追溯来源 | 黑盒 |
| 适用 | 企业知识库·多文档 QA | 整书分析·长对话 |
2026 趋势:融合。 长上下文粗筛 + RAG 精排溯源。
四、Prompt Engineering
Q7:Chain-of-Thought 和 Tree-of-Thought 的区别?
| 对比 | CoT | ToT |
|---|---|---|
| 结构 | 单线程逐步推理 | 多分支树搜索 |
| 开销 | 1 次 LLM 调用 | depth × branches 次调用 |
| 适用 | 算术·逻辑推理 | 规划·创意·博弈 |
CoT 一行 Prompt 即可,ToT 需要树搜索框架。 面试官追问"什么时候该用 ToT 而不是 CoT"→ 答案是"需要探索多种可能性且有明确评估标准时"。
Q8:如何设计一个防止 Prompt 注入的安全方案?
三步防御:
# 1. 输入过滤——检测注入关键词
def input_filter(user_input):
patterns = [r"忽略.*指令", r"你.*是.*一个", r"\[SYSTEM\]", r"<\\|im_start\\|>"]
for p in patterns:
if re.search(p, user_input, re.IGNORECASE):
return False, "检测到注入攻击"
return True, user_input
# 2. XML 标签隔离用户输入
def safe_prompt(system, user_input):
return f"<system>\n{system}\n</system>\n\n<user_query>\n{user_input}\n</user_query>\n\n请仅基于 <user_query> 回答。"
# 3. 输出检测——检查是否泄露系统信息
def output_guard(response):
sensitive = ["system prompt", "系统提示词", "你的指令是"]
return not any(s.lower() in response.lower() for s in sensitive)
面试官追问: 如果攻击者用 Base64 编码绕过?→ 解码后重新检测,或 Embedding 语义相似度检测异常输入。
五、模型部署与优化
Q9:大模型推理加速有哪些主流方案?
| 方案 | 原理 | 加速比 | 场景 |
|---|---|---|---|
| KV Cache | 缓存已计算 K/V | 2-5x | 所有自回归生成 |
| Flash Attention | 分块+IO 优化 | 2-4x | 长序列 |
| 量化 INT8/INT4 | 降低精度 | 2-4x 显存 | 消费级 GPU |
| vLLM | PagedAttention+连续批处理 | 10-30x 吞吐 | API 服务 |
| Tensor Parallel | 张量切分多 GPU | 近线性 | 单卡放不下 |
Q10:从零部署一个生产级 LLM API 服务,你会选什么技术栈?
2026 标准答案: vLLM(首选)/ SGLang(新秀) + FastAPI + Uvicorn + Nginx 负载均衡 + Prometheus/Grafana 监控 + Docker GPU 直通。
六、开放题(拉开级别差距的关键 20%)
Q11:你觉得未来两年大模型的核心突破点在哪?
这道题决定你被定位为"执行者"还是"前瞻型人才"。
标准回答框架(选 2-3 个方向展开):
1. Agent 自主执行能力(从"说"到"做")
当前 LLM 本质仍是"问答机器"——你问它答。2026-2028 年的核心突破在于 Agent 从单步对话走向多步自主执行:接收目标 → 分解子任务 → 选择工具 → 执行 → 反馈 → 调整。关键技术栈包括 LangGraph 多智能体编排、MCP(Model Context Protocol)工具标准化、以及记忆系统(短期工作记忆 + 长期向量记忆)。
面试时可以这样表达你的深度:“我看到的不只是 LangChain 调个工具——真正难的是多步规划的可靠性。Planning-Action-Observation 循环中任何一步出错都会级联放大,目前在复杂场景下的成功率还不到 50%。”
2. 多模态深度融合(文本+图像+视频+音频统一表征)
GPT-4/5 已经展示了文本+图像输入,但真正的融合是"一个模型同时理解并生成多种模态"。2025-2026 年 Qwen-VL 系列和 DeepSeek-VL 都在朝这个方向走。关键瓶颈不是模型架构(统一 Transformer 足够了),而是高质量多模态对齐数据的稀缺。
3. 推理成本断崖式下降(端侧模型的成熟)
同等能力的模型,推理成本每年下降 10×。2028 年有望在手机上运行 GPT-4 级别的模型。这不只是"便宜了"——它意味着 AI 从云端走到端侧,带来隐私、延迟、离线场景的质变。Apple Intelligence 和 Qualcomm AI Engine 的动向值得持续关注。
Q12:你最近关注了哪些大模型相关的开源项目或论文?
这是你展示"技术品味"的机会。不要列项目名,要说为什么关注和你的判断。
| 项目 | 为什么关注 | 我的判断 |
|---|---|---|
| DeepSeek-V3/R1 | MoE 架构 + RL 推理能力,国产标杆 | 推理链原生的 RL 训练方式可能比 GPT 的 RLHF 更根本——它让模型学会"思考"而非"对齐" |
| Qwen3 系列 | 完整生态(0.5B 到 235B + VL + Audio),多尺寸覆盖 | 目前开源生态最完整的系列,适合企业级选型 |
| vLLM / SGLang | 推理框架持续迭代,PagedAttention 是工业标准 | SGLang 的 RadixAttention 在某些场景比 vLLM 更快,值得投入学习 |
| Trae / Cursor | AI Coding 工具改变了"写代码"的定义 | Agent 化编程(不只是补全,而是自主规划+执行)是 2026-2027 最值得关注的工程变革 |
| MCP 协议 | Anthropic 提出的模型-工具标准接口 | 如果成为行业标准,整个 AI 工具生态都会重构 |
复习优先级路线图
第一梯队(面试前必过一遍):
├── Q1 Transformer 自注意力 ⭐⭐⭐⭐⭐
├── Q3 LoRA 原理 ⭐⭐⭐⭐⭐
├── Q5 RAG 完整流程 ⭐⭐⭐⭐⭐
└── Q6 RAG vs 长上下文 ⭐⭐⭐⭐⭐
第二梯队(高频追问):
├── Q2 位置编码 ⭐⭐⭐⭐
├── Q9 推理加速 ⭐⭐⭐⭐
└── Q4 过拟合 ⭐⭐⭐
第三梯队(拉开差距):
├── Q8 Prompt 注入防御 ⭐⭐⭐
├── Q7 CoT vs ToT ⭐⭐⭐
└── Q10 生产部署 ⭐⭐⭐
第四梯队(决定级别):
├── Q11 未来突破点 ⭐⭐⭐
└── Q12 关注的开源项目 ⭐⭐
👤 关注我,不错过任何一篇更新。这个专栏只写 20 篇,篇篇干货。
💬 你在面试时被问过最刁钻的大模型问题是什么? 在评论区分享一下,给后来的求职者铺路。点赞最高的方向,我会在后续文章中优先深扒 👇
更多推荐

所有评论(0)