2026 年大厂 AI/LLM 岗位面试,无论你面的是算法岗还是工程岗,这 12 道题的出现概率超过 80%。我面试了 40+ 个候选人后,把每次必问、每次有人栽的题整理成了这份清单——从 Transformer 到 RAG,从 LoRA 到部署优化,每道题附带面试官追问方向、可运行代码和加分回答技巧。


速查表(面试前 3 分钟过一遍·建议截图保存)

#问题核心答案面试频率最易栽的坑
Q1Transformer 自注意力计算过程?QKV 投影→Score = QK^T/√dk→Softmax→加权 V⭐⭐⭐⭐⭐不知道 √dk 为什么是 √dk
Q2位置编码有几种?正弦/可学习/RoPE/ALiBi,2026 主流 RoPE⭐⭐⭐⭐说不出 RoPE 为什么能外推
Q3LoRA 原理?冻结原参数,旁路插入低秩矩阵 B×A⭐⭐⭐⭐⭐把"低秩"解释成"参数少"
Q4微调过拟合怎么办?lr=1e-4~5e-4, 1-3 epoch, 数据质量>数量⭐⭐⭐只会调 lr 不会加 dropout
Q5RAG 完整流程?切分→Embedding→向量库→检索 Top-K→注入 Prompt→生成⭐⭐⭐⭐⭐跳过了检索策略(BM25+向量混合)
Q6RAG vs 长上下文?RAG 低成本可溯源长上下文全量但贵2026 趋势融合
Q7CoT vs ToT?CoT 单线程推理ToT 多分支树搜索⭐⭐⭐
Q8Prompt 注入怎么防?输入过滤→Prompt 分隔→输出检测⭐⭐⭐只说了"加分隔符"
Q9推理加速方案?KV Cache/Flash Attention/量化/vLLM/TP⭐⭐⭐⭐说不出 vLLM PagedAttention 原理
Q10生产级 LLM API 技术栈?vLLM/SGLang+FastAPI+Nginx+Prometheus⭐⭐⭐漏了监控和容器化
Q11大模型未来两年突破点?Agent 自主执行·多模态融合·端侧推理·推理成本⭐⭐⭐只泛泛而谈,没有具体路线图
Q12关注的开源项目?DeepSeek/Qwen3/vLLM·SGLang/AI Coding⭐⭐只列名字不说为什么关注

五大模块关系图(面试知识体系)

一、Transformer 核心
(基础·必考)

二、模型微调
(高频追问)

三、RAG
(系统设计)

四、Prompt Engineering
(安全专项)

五、模型部署
(架构加分)

六、开放题
(决定级别)

Q1·自注意力 | Q2·位置编码

Q3·LoRA | Q4·过拟合

Q5·RAG流程 | Q6·vs长上下文

Q7·CoT/ToT | Q8·注入防御

Q9·推理加速 | Q10·API部署

Q11·趋势 | Q12·开源


一、Transformer 核心机制

Q1:请简述 Transformer 的自注意力机制计算过程

面试官想听到的三层回答:

  1. Q、K、V 三个矩阵的来源(输入 X 分别乘以 Wq、Wk、Wv)
  2. 注意力分数公式 + √dk 缩放的作用
  3. 多头注意力的意义

标准答案:

自注意力让序列中每个 token 关注所有其他 token。计算分四步:

  • 输入 X 通过三个权重矩阵投影,得 Q(查询)、K(键)、V(值)
  • Score = Q × K^T / √dk
  • Softmax 归一化得到注意力权重
  • 权重 × V 得到输出

📖 关于为什么是 QKV 而不是直接用 X、√dk 为什么是 √dk、多头到底"多"了什么——我在 Transformer 面试官视角——5 个必挖考点 中逐问拆解了面试官内心真实想法,建议配合阅读。

代码:

import torch
import torch.nn.functional as F

def scaled_dot_product_attention(Q, K, V, mask=None):
    d_k = Q.size(-1)
    scores = torch.matmul(Q, K.transpose(-2, -1)) / torch.sqrt(torch.tensor(d_k, dtype=torch.float32))
    if mask is not None:
        scores = scores.masked_fill(mask == 0, float('-inf'))
    attention_weights = F.softmax(scores, dim=-1)
    return torch.matmul(attention_weights, V), attention_weights

Q2:位置编码有哪几种?各有什么优缺点?

类型原理优点缺点
正弦位置编码sin/cos 固定编码可外推表达能力有限
可学习位置编码随机初始化训练更新灵活不能外推
RoPE(LLaMA/Qwen)旋转矩阵编码相对位置外推强·相对位置好实现稍复杂
ALiBi(Bloom)注意力分数加线性偏置零额外参数长文本弱

2026 标准结论: RoPE 是事实标准。LLaMA 3、Qwen 3、DeepSeek 全部用 RoPE。面试时只说"RoPE 好"不够——要说清楚为什么能外推(编码相对位置关系,而非绝对位置)。

📖 RoPE 外推原理的深度拆解,含代码验证,见 Transformer 面试官视角 考点五。


二、模型微调

Q3:LoRA 微调的原理是什么?

核心: 冻结原权重 W,旁路插入低秩矩阵 B×A(rank 通常 8-16),只训练 B 和 A。参数量减少 99%+。

from peft import LoraConfig, get_peft_model
from transformers import AutoModelForCausalLM

model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2.5-7B")
lora_config = LoraConfig(
    r=16, lora_alpha=32,
    target_modules=["q_proj","k_proj","v_proj","o_proj","gate_proj","up_proj","down_proj"],
    lora_dropout=0.05, bias="none", task_type="CAUSAL_LM"
)
model = get_peft_model(model, lora_config)
model.print_trainable_parameters()
# trainable params: 8,388,608 || all params: 7,615,811,584 || trainable%: 0.1101

📖 LoRA 从 rank 选择、QLoRA 区别、训练实战到 7 个坑,完整拆解见 LoRA 微调 8 连问——面试官视角。


Q4:微调时遇到过拟合怎么办?

实战框架:

  • LoRA lr = 1e-4~5e-4(比全参高 10-20×)
  • SFT 阶段 1-3 epoch 足够
  • 5000 条高质量数据 > 50000 条噪声数据
  • 增加 lora_dropout 到 0.1 + warmup
  • 验证集 Loss 不再下降就停

三、RAG(检索增强生成)

Q5:请解释 RAG 的完整工作流程

三步流程: 文档切分→Embedding→向量库 | Query→检索 Top-K | 注入 Prompt→LLM 生成

环节选择注意
文档切分512 tokens, overlap 64语义完整性优先
Embeddingbge-large-zh / text2vec中文场景选中文模型
向量数据库Milvus/Chroma百万以下用 Chroma
检索策略BM25 + 向量混合纯向量对关键词不敏感
from langchain.text_splitter import RecursiveCharacterTextSplitter
from langchain.embeddings import HuggingFaceEmbeddings
from langchain.vectorstores import Chroma

splitter = RecursiveCharacterTextSplitter(chunk_size=512, chunk_overlap=64)
chunks = splitter.split_documents(documents)
embeddings = HuggingFaceEmbeddings(model_name="BAAI/bge-large-zh-v1.5")
vectorstore = Chroma.from_documents(chunks, embeddings)
retriever = vectorstore.as_retriever(search_kwargs={"k": 5})

Q6:RAG 和长上下文窗口(如 1M tokens)各有什么优劣势?

2026 面试超级高频题。

维度RAG长上下文
成本低(只处理相关片段)高(全量 tokens)
延迟检索几 ms上下文越长越慢
准确率取决于检索质量不会漏但有"大海捞针"
可控性可追溯来源黑盒
适用企业知识库·多文档 QA整书分析·长对话

2026 趋势:融合。 长上下文粗筛 + RAG 精排溯源。


四、Prompt Engineering

Q7:Chain-of-Thought 和 Tree-of-Thought 的区别?

对比CoTToT
结构单线程逐步推理多分支树搜索
开销1 次 LLM 调用depth × branches 次调用
适用算术·逻辑推理规划·创意·博弈

CoT 一行 Prompt 即可,ToT 需要树搜索框架。 面试官追问"什么时候该用 ToT 而不是 CoT"→ 答案是"需要探索多种可能性且有明确评估标准时"。


Q8:如何设计一个防止 Prompt 注入的安全方案?

三步防御:

# 1. 输入过滤——检测注入关键词
def input_filter(user_input):
    patterns = [r"忽略.*指令", r"你.*是.*一个", r"\[SYSTEM\]", r"<\\|im_start\\|>"]
    for p in patterns:
        if re.search(p, user_input, re.IGNORECASE):
            return False, "检测到注入攻击"
    return True, user_input

# 2. XML 标签隔离用户输入
def safe_prompt(system, user_input):
    return f"<system>\n{system}\n</system>\n\n<user_query>\n{user_input}\n</user_query>\n\n请仅基于 <user_query> 回答。"

# 3. 输出检测——检查是否泄露系统信息
def output_guard(response):
    sensitive = ["system prompt", "系统提示词", "你的指令是"]
    return not any(s.lower() in response.lower() for s in sensitive)

面试官追问: 如果攻击者用 Base64 编码绕过?→ 解码后重新检测,或 Embedding 语义相似度检测异常输入。


五、模型部署与优化

Q9:大模型推理加速有哪些主流方案?

方案原理加速比场景
KV Cache缓存已计算 K/V2-5x所有自回归生成
Flash Attention分块+IO 优化2-4x长序列
量化 INT8/INT4降低精度2-4x 显存消费级 GPU
vLLMPagedAttention+连续批处理10-30x 吞吐API 服务
Tensor Parallel张量切分多 GPU近线性单卡放不下

Q10:从零部署一个生产级 LLM API 服务,你会选什么技术栈?

2026 标准答案: vLLM(首选)/ SGLang(新秀) + FastAPI + Uvicorn + Nginx 负载均衡 + Prometheus/Grafana 监控 + Docker GPU 直通。


六、开放题(拉开级别差距的关键 20%)

Q11:你觉得未来两年大模型的核心突破点在哪?

这道题决定你被定位为"执行者"还是"前瞻型人才"。

标准回答框架(选 2-3 个方向展开):

1. Agent 自主执行能力(从"说"到"做")

当前 LLM 本质仍是"问答机器"——你问它答。2026-2028 年的核心突破在于 Agent 从单步对话走向多步自主执行:接收目标 → 分解子任务 → 选择工具 → 执行 → 反馈 → 调整。关键技术栈包括 LangGraph 多智能体编排、MCP(Model Context Protocol)工具标准化、以及记忆系统(短期工作记忆 + 长期向量记忆)。

面试时可以这样表达你的深度:“我看到的不只是 LangChain 调个工具——真正难的是多步规划的可靠性。Planning-Action-Observation 循环中任何一步出错都会级联放大,目前在复杂场景下的成功率还不到 50%。”

2. 多模态深度融合(文本+图像+视频+音频统一表征)

GPT-4/5 已经展示了文本+图像输入,但真正的融合是"一个模型同时理解并生成多种模态"。2025-2026 年 Qwen-VL 系列和 DeepSeek-VL 都在朝这个方向走。关键瓶颈不是模型架构(统一 Transformer 足够了),而是高质量多模态对齐数据的稀缺。

3. 推理成本断崖式下降(端侧模型的成熟)

同等能力的模型,推理成本每年下降 10×。2028 年有望在手机上运行 GPT-4 级别的模型。这不只是"便宜了"——它意味着 AI 从云端走到端侧,带来隐私、延迟、离线场景的质变。Apple Intelligence 和 Qualcomm AI Engine 的动向值得持续关注。


Q12:你最近关注了哪些大模型相关的开源项目或论文?

这是你展示"技术品味"的机会。不要列项目名,要说为什么关注和你的判断。

项目为什么关注我的判断
DeepSeek-V3/R1MoE 架构 + RL 推理能力,国产标杆推理链原生的 RL 训练方式可能比 GPT 的 RLHF 更根本——它让模型学会"思考"而非"对齐"
Qwen3 系列完整生态(0.5B 到 235B + VL + Audio),多尺寸覆盖目前开源生态最完整的系列,适合企业级选型
vLLM / SGLang推理框架持续迭代,PagedAttention 是工业标准SGLang 的 RadixAttention 在某些场景比 vLLM 更快,值得投入学习
Trae / CursorAI Coding 工具改变了"写代码"的定义Agent 化编程(不只是补全,而是自主规划+执行)是 2026-2027 最值得关注的工程变革
MCP 协议Anthropic 提出的模型-工具标准接口如果成为行业标准,整个 AI 工具生态都会重构

复习优先级路线图

第一梯队(面试前必过一遍):
├── Q1 Transformer 自注意力 ⭐⭐⭐⭐⭐
├── Q3 LoRA 原理 ⭐⭐⭐⭐⭐
├── Q5 RAG 完整流程 ⭐⭐⭐⭐⭐
└── Q6 RAG vs 长上下文 ⭐⭐⭐⭐⭐

第二梯队(高频追问):
├── Q2 位置编码 ⭐⭐⭐⭐
├── Q9 推理加速 ⭐⭐⭐⭐
└── Q4 过拟合 ⭐⭐⭐

第三梯队(拉开差距):
├── Q8 Prompt 注入防御 ⭐⭐⭐
├── Q7 CoT vs ToT ⭐⭐⭐
└── Q10 生产部署 ⭐⭐⭐

第四梯队(决定级别):
├── Q11 未来突破点 ⭐⭐⭐
└── Q12 关注的开源项目 ⭐⭐

👤 关注我,不错过任何一篇更新。这个专栏只写 20 篇,篇篇干货。

💬 你在面试时被问过最刁钻的大模型问题是什么? 在评论区分享一下,给后来的求职者铺路。点赞最高的方向,我会在后续文章中优先深扒 👇

更多推荐