在上篇文章《备战大模型应用开发面试?这份题库直接参考!》的基础上,再增加下面实战的面试题目
1.面对垂直领域的知识问答需求,你如何决定是采用 RAG(检索增强) 还是 Fine-tuning(微调)?如果数据更新频率极高(如每日新闻),微调是否可行?
2.如果业务需要处理单次 10 万字以上的文档(如法律卷宗),你会选择 128K 超长上下文模型 直接输入,还是采用 分段 RAG + MapReduce 的方式?请从成本、准确率和推理时延三个维度对比。
3.复杂的业务逻辑(如自动化财务审计),是用一个 Super Prompt(包含所有 SOP)引导模型,还是拆分成多个 专门的 Agent 协作?判定拆分的临界点在哪里?
4.企业级应用选型时,在什么情况下你会坚持使用 私有化部署的开源模型(如 Qwen/Llama),而不是直接调用 GPT-4 等闭源 API?
5.针对 PDF 报告、Excel 表格、代码库这三种截然不同的数据,你会分别选择什么样的 切片算法?如何防止语义在切片处断裂?
6.为什么在专业领域问答中,单纯的 向量检索(Vector Search) 往往不如 混合检索(Hybrid Search,向量+关键词)?
7.引入 Reranker(如 BGE-Reranker) 会增加数百毫秒的延迟,在什么场景下这笔开销是必须支付的?
8.面对千万级以上的数据量,在 pgvector (关系型扩展)、Milvus (分布式原生) 和 Faiss (本地库) 之间,你的选型标准是什么?
9.在生产环境中,你会选 vLLM、TensorRT-LLM 还是 Ollama?如果追求 多用户并发下的高吞吐量,你会优先考虑哪个特性(如 PagedAttention)?
10.在部署 70B 规格的大模型时,为了节省显存,你会选 AWQ、GPTQ 还是 GGUF?量化位数(4-bit vs 8-bit)对业务逻辑的影响如何评估?
12.如何设计一个 智能路由层,自动将简单的打招呼发给轻量模型(如 GPT-4o-mini),将复杂逻辑发给旗舰模型(如 GPT-4o),以平衡成本和体验?
13.除了 KV Cache,你会考虑在应用层引入 Semantic Cache(语义缓存) 吗?它与传统的 Redis 缓存有什么本质区别?
14.业务方问你“这个模型到底好不好用”,你会用哪些指标回答?如何构建一套针对业务场景的 离线测试集(Gold Dataset)?
15.在没有标准答案(Open-ended)的生成任务中,使用 更强模型(如 GPT-4)给弱模型打分 的可靠性如何?你会如何降低评分的主观偏差?
16.当新业务上线,既没有用户反馈数据,也没有微调样本时,你会如何设计 第一版架构 来快速跑通 MVP?

点击访问 ,获取全部面试题和答案,

更多推荐