logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

大模型基础 | 第四章Transformer性能优化之SparseAttention

本文系统介绍了Transformer模型中的稀疏注意力机制及其优化方法。针对标准自注意力机制在处理长序列时存在的O(n²)计算复杂度问题,提出了三种优化方案:膨胀自注意力通过周期性采样保持全局感知,局部自注意力聚焦固定窗口实现线性复杂度,混合稀疏注意力结合二者优势形成"局部紧密+远程稀疏"模式。这些方法通过打破全局关联假设,在计算效率与表达能力间取得平衡,有效解决了长序列处理中

文章图片
#transformer#深度学习#人工智能 +3
大模型基础 | Transformer性能优化之LinearAttention

本文探讨了Transformer模型中的线性注意力机制,旨在解决传统自注意力计算复杂度随序列长度呈平方级增长的问题。通过分析矩阵乘法时间复杂度,文章指出传统注意力计算QK^T的复杂度为O(n²d),而K^TV计算复杂度仅为O(nd²)。线性注意力的核心思想是改变计算顺序,利用核函数将注意力重写为ϕ(Q)(ϕ(K)^Tϕ(V)),将总体复杂度降低到O(nd²)。这种线性化方法显著提升了模型处理长序列

文章图片
#transformer#深度学习#人工智能 +3
大模型基础 | dropout机制

Dropout机制摘要 Dropout是一种有效的神经网络正则化技术,通过随机"丢弃"部分神经元(概率p)来防止过拟合。其核心原理包括:1)作为模型集成方法,训练多个子网络;2)减少神经元依赖,增强特征鲁棒性。训练时需引入1/(1-p)的缩放因子保持期望一致,但会增大方差。AlphaDropout通过仿射变换调整丢弃值,保持数据统计特性。这种机制简单高效,能显著提升模型泛化能力

文章图片
#自然语言处理#transformer#nlp +4
大模型基础 | Transformer-KVCache

摘要:Transformer解码器在自回归语言建模中,通过KV缓存机制优化推理效率。当前token的Query(Q)实时计算,而Key(K)和Value(V)则缓存历史信息,确保模型仅基于已生成内容预测下一token。这种设计避免了重复计算,将时间复杂度从O(t²)降至O(t),同时保持因果性——通过掩码防止未来信息泄露。KV缓存使GPT等模型能高效生成连贯文本,每次只需计算当前Q与历史K的点积,

文章图片
#transformer#深度学习#人工智能
大模型面试基础 | Transformer-MHA、MQA、GQA以及MLA技术区别

本文对比了Transformer中的四种注意力机制:MHA(多头注意力)、MQA(多查询注意力)、GQA(分组查询注意力)和MLA(多头潜在注意力)。MHA是标准多头机制,每个头独立计算K、V,但KV Cache占用大。MQA通过所有头共享K、V显著减少缓存开销。GQA是折中方案,分组共享KV以平衡性能与内存。MLA则采用低秩压缩键值来降低缓存需求,同时保持多头查询能力。这些技术在不同场景下权衡了

文章图片
#transformer#深度学习#人工智能 +2
大模型基础 | 归一化的作用

摘要 归一化技术在Transformer等深度学习模型中起着关键作用,它通过将不同特征缩放到相同尺度来解决梯度消失和训练不稳定的问题。本文通过房价预测的实例,生动解释了未归一化数据导致的问题:特征尺度差异造成梯度更新失衡,大数值特征更新剧烈而小数值特征更新缓慢,形成椭圆形损失等高线,严重影响收敛效率。同时分析了梯度下降原理,展示了未归一化数据如何使激活函数进入饱和区,引发真正的梯度消失。最后阐明归

文章图片
#transformer#深度学习#人工智能 +4
大模型面试基础 | 归一化算法BatchNorm、LayerNorm、RMSNorm

文深入探讨了神经网络中的归一化技术及其应用机制。首先指出强行归一化可能削弱模型表达能力,导致激活函数进入饱和区,引发梯度消失问题。随后详细对比了三种主流归一化方法:BatchNorm(按特征维度归一化)、LayerNorm(按样本内部归一化)和RMSNorm(仅计算均方根),通过数学公式和表格示例阐明其计算差异。

文章图片
#算法#transformer#深度学习 +4
大模型基础 | 模型参数初始化

模型参数初始化是神经网络训练的重要第一步,直接影响模型性能和收敛速度。固定权重初始化可能导致收敛缓慢,而固定方差初始化需要平衡方差大小以避免梯度消失或信号消失。Xavier初始化根据神经元数量和激活函数类型自动调整方差,保持数据在传播过程中的稳定性。Kaiming初始化则针对ReLU函数的特性进行优化。不同激活函数(如Tanh、Sigmoid)需要不同的方差补偿策略。预训练权重(如BERT)通过大

#机器学习#人工智能#自然语言处理 +4
大模型基础 | 大模型集成方法

摘要 本文探讨了大模型集成方法,重点介绍了三种主流技术:输出集成、概率集成和混合专家模型(MoE)。输出集成通过跨模型交流提升推理能力;概率集成对模型预测的logits结果进行平均处理;MoE则采用专家细粒度化和共享专家机制,在保持计算效率的同时提升模型性能。特别介绍了DeepSeekMoE的创新架构,包括专家细粒度化和共享专家设计,通过精细化的专家组合和通用/特定特征分离,显著提升了模型的泛化能

文章图片
#transformer#深度学习#人工智能 +4
Deepseek Agent Harness教程(四) | 为什么插件必须可逆

本文深入探讨了插件卸载时的资源清理问题,揭示了不处理资源释放会导致热重载失效等隐患。文章通过实例展示了未清理的定时器、事件监听器等资源如何造成重复注册和内存泄漏,并指出这类问题难以复现的特点。核心解决方案是使用ctx.effect()包装框架无法自动管理的资源(如定时器、文件监听等),同时指出71%的Cordis内置API已自动处理资源释放。最后解析了插件生命周期的六种状态及其转换逻辑,帮助开发者

文章图片
#ubuntu#linux#运维
    共 38 条
  • 1
  • 2
  • 3
  • 4
  • 请选择