一、面试问题

  1. 讲一下SRAM和HBM主要的区别。
  2. Websocket和SSE、HTTP这三者之间的关联和区别是什么?
  3. 在FlashAttention中,如果不用SRAM进行优化,HBM的吞吐量会有什么变化;SRAM和HBM哪个处理速度更快?
  4. 讲一下LoRA微调的原理
  5. AWQ和GPTQ算法的核心差别
  6. 除了LoRA之外还用到了哪些优化大模型判断能力的方法
  7. 使用过哪些云GPU厂商提供的服务
  8. 描述一下最新的一篇论文的核心创新点以及原理
  9. 描述一下RAG框架
  10. RAG中原始的比如markdown、HTML这些数据是如何切片之后存入向量数据库的
  11. 在生产消费者模型中,如果消费者的消费能力远低于生产者
  12. 解释一下PagedAttention的原理
  13. 了解过K8S系统吗?其中的Deploy主要是做什么
  14. 在RAG中,如果用户的prompt比较长,从推理优化的角度分析,应该从哪些角度进行分析问题源
  15. 有了解过现在的这些推理框架吗?比如vllm,架构是什么
  16. 在Transformer中推理的过程是什么?(提示自回归)
  17. CNN的原理是什么?
  18. 为什么采用Postgre作为向量数据库?为什么不用milvus
  19. 数据库中的索引有没有了解过,原理是什么
  20. 在推理的时候,生成第一个token和生成后面的token的过程之间有什么区别?
  21. rerank的原理是什么?
  22. 有没有了解过云端部署推理框架的平台?
  23. KV Cache占用空间的大小计算。

二、算法题

  1. leetcode160:Intersect of two linked list

三、反问

  1. 这个岗位主要是做什么?
    向企业内部提供中台服务

更多推荐