logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

大模型切分总结

矩阵运算基础 Y=XW+B, X:输入, W:参数, Y:输出。三步:正向计算Y、反向计算梯度、反向更新参数。multi-head attention, TP 为Head group。长文本输入,ring-attention或者all2all。laynorm函数, 通常与TP相等。FNN层,降低参数规模。模型按stage层切。切(all2all)

大模型transformer架构训练和推理方法

因为训练可以“靠老师”,推理还得“靠自己”,这样推理时遇到的错误输出对于下次推理来说就是在训练数据分布之外(out of distribution)的异常输入,所以会导致用Teacher Forcing模式训练出来的模型在训练环节和预测环节存在行为差异。具体来说,Teacher Forcing就是每次推理给解码器输入时,不使用前次推理的输出作为下一次推理的增加输入,而是使用训练标签的真值(grou

#transformer#深度学习#人工智能
大模型TP、SP、EP切分

文章摘要:本文对比了传统Dense大模型和MoE大模型在并行计算方式上的差异。传统模型采用TP切分,Attention和FNN部分都需进行前向和反向各一次AR计算。而加入SP并行后,计算模式发生变化:前向的g{}变为AG,反向的g{}变为RS。文中以FNN部分为例说明计算模式转变,指出Attention部分也可采用类似处理方式。这反映了模型并行计算策略的演进过程。

大模型显示优化之ZeRO-1/ZeRO-2/ZeRO-3

zero-1、zero-2、zero-3 是deepspeed的配置方法,对应megatron也有相应的方法,Megatron-LM 的实现方式:Distributed Optimizer(分布式优化器)。等效于 ZeRO-1,Megatron 的 Distributed Optimizer 默认行为就是将优化器状态(Optimizer States)均匀地切分并分布在数据并行(DP)组的所有 G

#深度学习
大模型batchsize与梯度累积

在一个step最后optimizer 执行前,W的梯度会进行num_microbatches轮的累积,每轮还需要按DP维度进行累积。micro_batch_size 设置比较大,激活值存储很容易OOM,激活值需要至少保存micro_batch_size*seq_len*hidden_size*num_layers。通常说的梯度累积是W的梯度,X的梯度会在zbv的B阶段处理完就会丢弃。micro_b

#人工智能#深度学习
大模型显示优化之ZeRO-1/ZeRO-2/ZeRO-3

zero-1、zero-2、zero-3 是deepspeed的配置方法,对应megatron也有相应的方法,Megatron-LM 的实现方式:Distributed Optimizer(分布式优化器)。等效于 ZeRO-1,Megatron 的 Distributed Optimizer 默认行为就是将优化器状态(Optimizer States)均匀地切分并分布在数据并行(DP)组的所有 G

#人工智能#深度学习
Deepseek DSA 原理与训练

DSA(Deepseek Sparse Attention)技术摘要 DSA通过稀疏注意力(TopK选择)减少计算量,类似MoE思想。其核心是Lighting Indexer模块,从长上下文中筛选最相关的Token(如128K选2048),将计算复杂度从O(L²)降至O(LK)。训练分为两阶段: 密集预热阶段:冻结主模型,仅训练Indexer模仿全量注意力的分布(KL散度损失),使用2.1B To

#深度学习#人工智能#机器学习
昇腾与英伟达硬件架构对比

上图展示有点问题,实际一个Node的Level1里是一个交换芯片的7个虚拟平面,不是7个交换芯片。UB交换芯片Level1使用量0.392*2/2*8*2=6.272 Tb/s, Level2 交换芯片使用量0.056/2*8*48=10.752Tb/s,芯片性能对标博通TH3.B300出1.8TB双向带宽,Nvswitch单芯片容量28.8Tb,整机57.6Tb(性能对标博通TH5),交换芯片容

#硬件架构
昇腾与英伟达硬件架构对比

上图展示有点问题,实际一个Node的Level1里是一个交换芯片的7个虚拟平面,不是7个交换芯片。UB交换芯片Level1使用量0.392*2/2*8*2=6.272 Tb/s, Level2 交换芯片使用量0.056/2*8*48=10.752Tb/s,芯片性能对标博通TH3.B300出1.8TB双向带宽,Nvswitch单芯片容量28.8Tb,整机57.6Tb(性能对标博通TH5),交换芯片容

#硬件架构
PD分离推理网络亲和性调度

一般先根据负载均衡选Decode节点(Decode节点是长期持有状态),再根据Decode节点,就近选Prefill节点(Prefill节点是无状态的,位置灵活)。更进一步,当同一个用户的请求有历史KV Cache(比如多轮对话)时,优先把新请求调度到缓存了上一轮KV Cache的Decode节点附近的Prefill节点,避免KV Cache的二次迁移。Decode节点有状态,不能随便动,一个请求

#网络#人工智能#深度学习
    共 23 条
  • 1
  • 2
  • 3
  • 请选择