【面试经验】小红书大模型平台推理部署实习生
·
一、面试问题
- 讲一下SRAM和HBM主要的区别。
- Websocket和SSE、HTTP这三者之间的关联和区别是什么?
- 在FlashAttention中,如果不用SRAM进行优化,HBM的吞吐量会有什么变化;SRAM和HBM哪个处理速度更快?
- 讲一下LoRA微调的原理
- AWQ和GPTQ算法的核心差别
- 除了LoRA之外还用到了哪些优化大模型判断能力的方法
- 使用过哪些云GPU厂商提供的服务
- 描述一下最新的一篇论文的核心创新点以及原理
- 描述一下RAG框架
- RAG中原始的比如markdown、HTML这些数据是如何切片之后存入向量数据库的
- 在生产消费者模型中,如果消费者的消费能力远低于生产者
- 解释一下PagedAttention的原理
- 了解过K8S系统吗?其中的Deploy主要是做什么
- 在RAG中,如果用户的prompt比较长,从推理优化的角度分析,应该从哪些角度进行分析问题源
- 有了解过现在的这些推理框架吗?比如vllm,架构是什么
- 在Transformer中推理的过程是什么?(提示自回归)
- CNN的原理是什么?
- 为什么采用Postgre作为向量数据库?为什么不用milvus
- 数据库中的索引有没有了解过,原理是什么
- 在推理的时候,生成第一个token和生成后面的token的过程之间有什么区别?
- rerank的原理是什么?
- 有没有了解过云端部署推理框架的平台?
- KV Cache占用空间的大小计算。
二、算法题
- leetcode160:Intersect of two linked list
三、反问
- 这个岗位主要是做什么?
向企业内部提供中台服务
更多推荐
所有评论(0)