面试几乎都是挖简历,挖项目,考算法、考解决问题的能力。

1.你要不先做个简单的自我介绍?

2.你是在原来的公司工作三年的时间?

3.你研究生的工作主要是做什么的呀?项目主要是做什么的呀?

4.你上一家公司是?

5.你们大模型主要做什么的?你们公司大模型在做什么东西啊?为什么要建立一个大模型端到端数据训练推理流程?

6.那你们是基于什么模型去微调的?

7.你们训练语料,训练语料流程是什么样子的呢?

8.会建立哪些榜单啊?(测评)

9.那代码能力Claude code 已经很好了,你们能超过他们吗?为什么不直接用?

10.你们也会打榜,就是不会把打榜作为目标是吗?

11.因为全流程很长,那你主要聚焦在哪一部分?

12.这是怎么实现的呢?(16B大模型做手机AI智能助手)

13.也就是说你会做SFT和FLHF是吧?

14.然后你在里面的工作,你觉得主要的难点是什么?

15.增加新数据,可以对模型其他指标能力有影响,掉点问题怎么解决呢?

16.数据飞轮的话,你们是不是要训练很多的轮次?

17.建设飞轮数据的方案可以具体说一下吗?指的是什么事情?

18.工程实践方案是你负责吗?你是负责哪一部分,整个pipeline设计,包括算子,所有策略都是你来负责吗?

19.那你们数据评测的方法是什么?

20.显著缓解模型幻觉和输出不稳定问题是怎么解决的?

21.你们训练这个模型一般需要多少资源多久时间?(16B)

22.那你们16B模型是指哪个模型?千问吗?

23.那你们训练语料的量是多少?

24.用的什么卡训练?

25.训练效率提升是如何实现的?deepspeed

26.问一个问题哦,医疗领域,一般问大模型布洛芬胶囊孕妇能不能吃,它大概概率有些幻觉,有些药品说明书里会说孕妇不能吃。如果出现幻觉,何解?

27.我想在线下就能检查出来幻觉,有没有好的方式吗?我想知道,哪些是有幻觉的,而且不可能所有解决幻觉的方式都用上。

28.你还有一个开源的项目吗?个人的吗?开源项目是关于什么的项目啊?

29.你是偏算法的是吧,应用算法还是基础算法?

30.你对工作的地点要求是?

31.来杭州的原因是因为?要在杭州定居?

32.问一个基础的技术问题。(本面试间没有写代码功能所以叙述题目和解题过程)我们在一个很大(超大)的文件里面,文件里面每一行都是一个32位的整数。文件很大,可能会有重复出现的数。但是呢有一个整数,没有出现在这里面。你需要找出这个没出现的数。尽量内容用少一点,内存不能超过1GB。文件很大没有限制,文件类型也不重要。

33.那接着上一个问题,如果我们内存很小,其他的方法都可以采用,有什么办法找出这个?

34.你们做code的话,swe bench verified 关注过吗?你觉得这个榜单和你们做的榜单有什么区别?

35.人工生成语料肯定比不过自动化的、语料的准确率和量有什么提升方法吗?

36.如果是SWE线上抓取的,那你们生成的一条语料,应该包括哪些东西?应该输出一个什么东西给大模型用?什么形式的语料?

37.那它在RL训练的时候是怎么用呢?你觉得。

38.你觉得这个场景是多轮对话还是单轮对话?

39.能控制轮数收敛吗?

40.那我再问最后一个问题,你有做30亿token的数据,你们有什么资料筛选机制或者去毒去污的流程有什么设计?

41.具体说一下怎么实现语义相似度检查的。

42.那你们是怎么去做数据多样性啊,你们要做数据多样性的工作吗?

43.那还是医疗行业的问题,他们公开数据集比较少,文档文本有些获取也比较难,那有什么策略构建一些高质量的,能持续更新的医疗库,你有什么思路?

44.那你是怎么做数据合成的?合成数据的质量怎么保证?

45.你收到是MY什么层级的岗位啊?

46.那你对MY的层级有要求吗?

47.反问阶段

更多推荐