logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

大模型面试题:大模型推理中超出训练长度的外推方式有哪些?

摘要:本文总结了Transformer模型在推理时超出训练长度范围的外推方法,主要包括ALiBi、内插法、NTK-Aware和Yarn等四种主流技术。ALiBi通过添加不可学习的偏置实现外推,内插法通过缩放位置编码适应长文本,NTK-Aware采用动态调整的进制转换策略,而Yarn则结合了灵活进制设计和温度调节。这些方法各有特点,旨在解决模型在长序列推理时的性能下降问题。文章详细分析了每种方法的原

#语言模型#人工智能#机器学习 +1
大模型面试题:大模型训练模式和推理模式的主要流程和区别是什么?

我整理好的1000+面试题,请看或者最好将URL复制到浏览器中打开,不然可能无法直接打开好了,我们今天针对上面的问题,

#语言模型#人工智能#机器学习 +1
大模型面试题:大模型训练模式和推理模式的主要流程和区别是什么?

我整理好的1000+面试题,请看或者最好将URL复制到浏览器中打开,不然可能无法直接打开好了,我们今天针对上面的问题,

#语言模型#人工智能#机器学习 +1
我的总结的大模型面试题

整理好的1000+面试题在这里,懂得都懂哈,回复"资料"就可以获取啦。

#人工智能
大模型面试题:PPO等RL算法中怎么算KL散度的,KL散度不对称?

本文分析了PPO等强化学习算法中KL散度的计算方法及其不对称性。重点比较了正向KL和反向KL的数学形式与行为特性:正向KL对小概率事件敏感,倾向于广泛覆盖目标分布;反向KL对高概率区域敏感,更适用于生成任务。研究指出,在语言模型等生成任务中通常采用反向KL,因其能提高生成质量和稳定性。文中通过数学推导展示了两种KL散度的计算过程,并解释了它们在策略优化中的不同影响。

#机器学习#深度学习#人工智能
面试题:大模型sft为什么第二个epoch的时候loss会突然下降

摘要:研究发现大语言模型(LLM)在监督微调(SFT)过程中存在过拟合和输出单一化问题。实验显示随着微调epoch增加,训练损失阶梯式下降但验证损失上升,表明模型过度记忆训练数据。论文指出交叉熵损失(CE)导致模型过于自信、重复训练数据模式,削弱生成多样性。Fastai实验证实该现象具有普遍性,不同框架下均观察到模型在第二轮epoch时快速记忆数据、验证损失不稳定的特征。这种现象与微调方法(LoR

#机器学习#深度学习
大模型面试题:手写一下正弦编码和旋转位置编码的代码?

​我整理好的1000+面试题,请看或者最好将URL复制到浏览器中打开,不然可能无法直接打开​。

#人工智能#机器学习#深度学习 +1
面试题:大模型训练需要设置温度系数吗?

本文讨论了大模型训练中温度系数的设置问题。文章指出在训练阶段不需要设置温度系数(默认为1),而在推理阶段才需要调整温度系数来控制生成多样性。通过分析千问3的源码证实训练时确实不使用温度参数。同时解释了softmax函数的工作原理:模型输出原始logits分数,通过指数化和归一化转换为概率分布,其中指数化能保证正值并放大分数差异。文章建议参考相关面试题库获取更多技术细节。

#机器学习#深度学习#人工智能
大模型面试题:MoE中如何缓解专家选择不均衡的问题?

本文探讨了混合专家模型(MoE)中专家选择不均衡问题的解决方案。主要提出三种方法:1)在门控网络后应用dropout技术,通过随机激活专家来增强模型泛化能力;2)引入软约束损失函数,通过变异系数(CV)衡量专家重要性分布,并加入总体损失进行优化;3)参考ST-MoE模型的路由器损失机制,通过惩罚较大logits来提升训练稳定性。这些方法通过不同角度确保专家负载均衡,同时保持模型性能,有效解决了Mo

#人工智能#机器学习#深度学习 +1
大模型面试题:推导一下softmax中为啥要除以根号d

本文探讨了Softmax函数中除以√d的数学原理。通过假设Q和K为独立随机矩阵,推导得出未缩放时注意力分数方差随维度d线性增长,导致Softmax输出趋近one-hot分布和梯度消失问题。理论分析表明,除以√d能使方差稳定为1,使Softmax输入分布更平滑,有利于梯度传播。该缩放因子对Transformer模型的稳定训练具有关键作用。

#人工智能#机器学习#深度学习 +1
    共 60 条
  • 1
  • 2
  • 3
  • 6
  • 请选择