
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
zero-1、zero-2、zero-3 是deepspeed的配置方法,对应megatron也有相应的方法,Megatron-LM 的实现方式:Distributed Optimizer(分布式优化器)。等效于 ZeRO-1,Megatron 的 Distributed Optimizer 默认行为就是将优化器状态(Optimizer States)均匀地切分并分布在数据并行(DP)组的所有 G
DSA(Deepseek Sparse Attention)技术摘要 DSA通过稀疏注意力(TopK选择)减少计算量,类似MoE思想。其核心是Lighting Indexer模块,从长上下文中筛选最相关的Token(如128K选2048),将计算复杂度从O(L²)降至O(LK)。训练分为两阶段: 密集预热阶段:冻结主模型,仅训练Indexer模仿全量注意力的分布(KL散度损失),使用2.1B To
上图展示有点问题,实际一个Node的Level1里是一个交换芯片的7个虚拟平面,不是7个交换芯片。UB交换芯片Level1使用量0.392*2/2*8*2=6.272 Tb/s, Level2 交换芯片使用量0.056/2*8*48=10.752Tb/s,芯片性能对标博通TH3.B300出1.8TB双向带宽,Nvswitch单芯片容量28.8Tb,整机57.6Tb(性能对标博通TH5),交换芯片容
上图展示有点问题,实际一个Node的Level1里是一个交换芯片的7个虚拟平面,不是7个交换芯片。UB交换芯片Level1使用量0.392*2/2*8*2=6.272 Tb/s, Level2 交换芯片使用量0.056/2*8*48=10.752Tb/s,芯片性能对标博通TH3.B300出1.8TB双向带宽,Nvswitch单芯片容量28.8Tb,整机57.6Tb(性能对标博通TH5),交换芯片容
一般先根据负载均衡选Decode节点(Decode节点是长期持有状态),再根据Decode节点,就近选Prefill节点(Prefill节点是无状态的,位置灵活)。更进一步,当同一个用户的请求有历史KV Cache(比如多轮对话)时,优先把新请求调度到缓存了上一轮KV Cache的Decode节点附近的Prefill节点,避免KV Cache的二次迁移。Decode节点有状态,不能随便动,一个请求
昇腾C++代码是显式管理数据搬运和流水线的,而CUDA代码更像是为每个线程独立编写逻辑,硬件自动完成并行。
昇腾C++代码是显式管理数据搬运和流水线的,而CUDA代码更像是为每个线程独立编写逻辑,硬件自动完成并行。
摘要:本文分析了昇腾AI处理器两种通信路径——SDMA(卡间HCCS总线)和RDMA(跨机RoCE网络)的数据传输机制。SDMA路径通过HcclD2DMemcpyAsync实现HBM间直接异步传输,不经过AICore;RDMA路径则通过RoCE网卡DMA引擎直接读写注册的HBM物理地址,全程规避CPU参与。对比OpBase和Zcopy两种模式,前者需userIn到cclIn的拷贝但内存要求宽松,后
摘要:本文分析了昇腾AI处理器两种通信路径——SDMA(卡间HCCS总线)和RDMA(跨机RoCE网络)的数据传输机制。SDMA路径通过HcclD2DMemcpyAsync实现HBM间直接异步传输,不经过AICore;RDMA路径则通过RoCE网卡DMA引擎直接读写注册的HBM物理地址,全程规避CPU参与。对比OpBase和Zcopy两种模式,前者需userIn到cclIn的拷贝但内存要求宽松,后
摘要:本文分析了昇腾AI处理器两种通信路径——SDMA(卡间HCCS总线)和RDMA(跨机RoCE网络)的数据传输机制。SDMA路径通过HcclD2DMemcpyAsync实现HBM间直接异步传输,不经过AICore;RDMA路径则通过RoCE网卡DMA引擎直接读写注册的HBM物理地址,全程规避CPU参与。对比OpBase和Zcopy两种模式,前者需userIn到cclIn的拷贝但内存要求宽松,后







