
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
场景用哪个原因大模型数据并行训练的梯度同步规则、大块、全员参与MoE的专家路由分发选择性分发、细粒度模型并行中的张量切分通信规则集合通信稀疏图神经网络的邻居聚合不规则、动态目标分布式数据加载的Broadcast一对多规则分发规则的大块传输交给RCCL,不规则的细粒度One-Sided访问交给NVSHMEM。两个库不是"你死我活"的关系,而是各管一摊、互相配合。千卡集群上跑大模型训练,两个都得搞明白
能融合的都融合了:Reduce类算子3合1、大模型算子9合1——减少的是kernel launch开销和中间结果的显存读写,这些都是"看不见的耗时"该分开的都分开了:Prefill和Decoding走不同的实现路径,访存密集型和计算密集型各用各的优化策略——没有"一刀切"量化不只是精度换速度:SmoothQuant、W4A8重排压缩、多级流水掩盖——这是一套完整的量化部署方案,不只是把FP16换成
回到最实际的问题:如果你的团队在考虑国产化AI平台迁移,DAS值不值得投入?300+模型适配验证,拿来就能用,适配周期大幅缩短万卡集群验证通过,不只是小规模Demo,能上生产系统工程优化扎实,不是"能跑就行"的水平容器镜像 + FastPT工具链,工程化程度不错OpenDAS开源 + 版本快速迭代,生态在加速生长算子覆盖率跟CUDA生态还有数量级差距,LightOP 50+ vs CUDA数万Py
类别方案核心思路通信优化flux TP融合、A2A Overlap、量化通信、EDGC、SDP4bit让通信和计算重叠/压缩通信量显存优化参数副本复用、激活值卸载、Block-wise INT8省显存、降低精度成本调度优化消灭流水线气泡MoE专项专家负载均衡、低延迟通信大模型训练优化没有银弹。不同模型结构、不同规模、不同网络拓扑,最优方案都不一样。最好的策略是把这些方案都集成进训练框架,根据实际任
现象:编译报,比如float2和float的乘法运算符在两个头文件里都有定义。修法// 只在非 HIP 环境下生效的自定义实现#endif版本对齐是第一要务:DTK、PyTorch、FastPT 三个版本必须对得上,去 DAS 社区的 FastPT 仓查版本对应表。-C和-E各司其职-C管编译,-E管运行。编译好的 whl 包在新环境部署时只需-E,别手贱再跑一次-C。第一个 error 是关键:
Warp Size从32变64——线程块大小、共享内存bank冲突策略全部要重新评估动态并行不支持——kernel嵌套调用的逻辑需要展平,别硬搬__syncwarp不支持——线程束级细粒度同步得重新设计异步操作不支持——异步拷贝等场景用同步替代,IO模式需要调整Pinned Memory一定要用——Host↔Device带宽差距巨大,这步不做纯属浪费硬件迁移不是简单的API替换。把硬件差异吃透了,
安装:走DAS源,注意DTK版本匹配,别用官方PyTorch环境验证别忘,确认:一行代码换性能,但第一次编译要有耐心分布式:GPU训练无脑选RCCL,多节点注意网卡名和IB配置调优:NUMA绑定 + DataLoader参数 + profiler定位瓶颈,三步走。
互联拓扑架构领先:自研交换芯片 + Clos 全互联,P2P 带宽 448GB/s,对分带宽 1792GB/s,对比 Fullmesh 方案有 2-8 倍的差距。大模型 TP 并行和多机 Scale-Out 场景优势明显。软件生态兼容性好:HIP 编程模型 + DTK 数学库做到了 CUDA 兼容,PyTorch/vLLM 等主流框架覆盖度 98%+,迁移成本低。全场景覆盖:从 AI 训练推理到科
安装:走DAS源,注意DTK版本匹配,别用官方PyTorch环境验证别忘,确认:一行代码换性能,但第一次编译要有耐心分布式:GPU训练无脑选RCCL,多节点注意网卡名和IB配置调优:NUMA绑定 + DataLoader参数 + profiler定位瓶颈,三步走声明:本文基于公开技术资料与个人实践整理,所有具体版本号、内部节点名、性能数据均已做脱敏处理。文中mermaid图均为原创绘制。(内容由A
能融合的都融合了:Reduce类算子3合1、大模型算子9合1——减少的是kernel launch开销和中间结果的显存读写,这些都是"看不见的耗时"该分开的都分开了:Prefill和Decoding走不同的实现路径,访存密集型和计算密集型各用各的优化策略——没有"一刀切"量化不只是精度换速度:SmoothQuant、W4A8重排压缩、多级流水掩盖——这是一套完整的量化部署方案,不只是把FP16换成







