logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

lora矩阵的初始化为啥B矩阵为0呢,为啥不是A呢

在 LoRA 论文及其标准实现中,,而矩阵 $A$ 则使用标准的初始化方法(例如 Kaiming 或 Xavier 均匀分布)进行初始化。

#矩阵#深度学习#机器学习
如何实现 混合精度训练(AMP)?遇到NaN怎么处理呢

摘要:混合精度训练(AMP)通过同时使用float16和float32加速训练并减少显存占用,核心包括权重FP32保留、自动精度转换和损失缩放。PyTorch实现需使用GradScaler和autocast管理器。训练中遇到NaN可能由学习率过高、梯度爆炸或数据问题导致,建议通过异常检测定位问题,采取降低学习率、梯度裁剪或检查数据等措施解决。

#人工智能#深度学习#算法
attention注意力机制中为什么要在分母上除以根号dk?

摘要:注意力机制中缩放点积的核心目的是防止梯度消失,稳定训练过程。随着键向量维度增大,点积结果的方差变大,会导致softmax梯度趋近于零。通过除以√dk将方差稳定在1附近,避免梯度消失问题,同时使注意力分布更平滑,有利于模型学习不同位置间的关联。这一方法确保在不同维度下都能保持稳定的训练动态。

#人工智能#语言模型
深度学习中的损失函数都有哪些,大模型时代主要用的损失函数有哪些,中间有什么区别?

摘要:深度学习中的损失函数按任务类型分为回归(MSE、MAE等)、分类(交叉熵、Hinge等)和序列任务(CTC等)。大模型(如GPT、BERT)几乎统一采用带Label Smoothing的交叉熵损失,因其符合语言建模的概率本质,梯度稳定且泛化性强。Label Smoothing通过软化one-hot标签缓解过拟合,成为预训练阶段的主流选择。相比传统任务的定制化损失,大模型更注重通用性和可扩展性

#深度学习#人工智能
大模型decoder中权重矩阵的理解

组件主要权重矩阵/参数数量主要功能自注意力4 个矩阵关联序列中的不同位置信息前馈网络2 个矩阵进行非线性计算,增强模型表示能力归一化层2 组向量稳定训练过程一个完整的 GPT 模型是由很多个这样的 Decoder Block 堆叠起来的(例如 Llama-7B 有 32 个),再加上一些其他参数。

#矩阵#机器学习#人工智能
说一说大模型后训练的流程

大模型优化包含两个关键阶段:首先是监督微调(SFT),使用高质量指令-回答数据对训练模型理解指令并生成初步响应;随后是基于人类反馈的强化学习(RLHF),先训练奖励模型评估回答质量,再通过强化学习优化模型输出,使其更符合人类偏好。该方法显著提升了模型在有用性、诚实性和安全性方面的表现。

#机器学习#人工智能#算法
什么情况用bert模型,什么情况用llama、chaglm类的大模型?

当你的任务目标明确、输入和输出相对固定,并且更侧重于对输入文本的理解时,BERT 是一个性价比极高且效果出色的选择。典型应用场景:文本分类 (Text Classification):情感分析: 判断一段评论是正面的、负面的还是中性的。新闻分类: 将新闻文章自动归类到体育、科技、财经等频道。意图识别: 在对话系统中,判断用户输入的意图是“查询天气”还是“播放音乐”。命名实体识别 (Named En

#bert#人工智能
大模型灾难性的原因和缓解方法?

首先,可以简要解释什么是灾难性遗忘(Catastrophic Forgetting)。它指的是深度学习模型在学习新任务时,会显著遗忘之前已经学习过的旧任务的知识,导致在旧任务上的性能大幅下降的现象[1][2在持续学习或增量学习的场景中,这是一个关键的挑战[2。

#人工智能
深度学习中的损失函数都有哪些,大模型时代主要用的损失函数有哪些,中间有什么区别?

摘要:深度学习中的损失函数按任务类型分为回归(MSE、MAE等)、分类(交叉熵、Hinge等)和序列任务(CTC等)。大模型(如GPT、BERT)几乎统一采用带Label Smoothing的交叉熵损失,因其符合语言建模的概率本质,梯度稳定且泛化性强。Label Smoothing通过软化one-hot标签缓解过拟合,成为预训练阶段的主流选择。相比传统任务的定制化损失,大模型更注重通用性和可扩展性

#深度学习#人工智能
安装verl框架

verl是一个高性能的大模型强化学习训练框架,特别适用于复现类似的项目。它支持DAPO等前沿算法,并能与物理沙箱深度集成,训练模型调用工具的能力。504 Timeout 错误:通常是因为编译flash-attn时 CPU 负载过高或系统盘(/tmp)被塞满。解决方法是限流编译线程(MAX_JOBS)并重定向TMPDIR。:无卡开机时 vLLM 报此警告是正常的,只要nvcc -V能显示 12.8

#chrome#前端
    共 29 条
  • 1
  • 2
  • 3
  • 请选择