logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

大模型推理加速200%+?这套国产融合算子库把CUDA/Triton全替换了

能融合的都融合了:Reduce类算子3合1、大模型算子9合1——减少的是kernel launch开销和中间结果的显存读写,这些都是"看不见的耗时"该分开的都分开了:Prefill和Decoding走不同的实现路径,访存密集型和计算密集型各用各的优化策略——没有"一刀切"量化不只是精度换速度:SmoothQuant、W4A8重排压缩、多级流水掩盖——这是一套完整的量化部署方案,不只是把FP16换成

#人工智能#算法#机器学习
基于DCU的大模型推理优化深度解读

框架层:选对基座(vLLM)、做好适配(layout/调度/算子),让模型先"跑起来且跑得顺"算子层:瞄准热点(MLA/Attention/MoE),逐算子压榨,MLA优化是DeepSeek系模型的重中之重量化层:混合精度是王道——MoE用低比特(W4A8)、Attention保精度(W8A8),KVCache用FP8工具链:AutoTuning解决"每个模型每个硬件都要调"的工程化问题一句话概括

#人工智能
大模型Attention算子实现与优化深度解读

Softmax → Online Softmax → Flash Attention → Chain GEMM → 四级Buffer →Causal均衡 → 反向优化 → FlashMLA → 量化(FP8) + 稀疏化(BLASST/Sparge/SLA)Online Softmax是分块计算的理论基础,没有增量更新就没有后续的一切。Chain GEMM的落地关键是Gemm0多次mmac融合,省

#分布式#wpf
大模型分布式训练容错技术深度解读

分布式训练容错不是什么花活,是千卡以上规模训练必须过的坎。训前排雷:NHC + Rccl + GEMM 三重检测,别让坏节点混进训练池。训中兜底:hyckpt 异步 Checkpoint + 跨节点内存协同备份,故障恢复从分钟级压到秒级。自动闭环:状态机自动检测→隔离→替换→重启,全程不需要人盯着。目前这套方案在国产加速卡集群上已经跑过 64 节点 llama3_70b 的实测验证。后续方向包括适

#分布式#wpf
DCU大模型训练优化深度解读

类别方案核心思路通信优化flux TP融合、A2A Overlap、量化通信、EDGC、SDP4bit让通信和计算重叠/压缩通信量显存优化参数副本复用、激活值卸载、Block-wise INT8省显存、降低精度成本调度优化消灭流水线气泡MoE专项专家负载均衡、低延迟通信大模型训练优化没有银弹。不同模型结构、不同规模、不同网络拓扑,最优方案都不一样。最好的策略是把这些方案都集成进训练框架,根据实际任

#人工智能
Triton概述:你写的CUDA Kernel跑了三天才优化完,而Triton只用了30行Python

三年前第一次用CUDA写矩阵乘,对着__shared__调了一整个通宵,运行时间从 12ms 降到 8ms。隔壁实习生用 Triton 花了 30 分钟写出 30 行 Python,跑出来 7ms。那一刻想摔键盘。这是很多人接触 Triton 时的真实心路历程。它不是另一个深度学习框架——而是一把专门针对 GPU Kernel 开发的"自动挡"螺丝刀。

#pytorch
TritonIR剖析:从 Python Kernel 到 GPU 指令,TTIR/TTGIR 全流程拆解

Pass干啥为什么重要规范化 IR,常量折叠 + 代数化简让后续 Pass 更容易命中模式CSE消除重复计算省寄存器、省 ALU,提升 occupancyInliner展开所有函数调用GPU 不支持 call,必须内联拆解张量指针为底层地址计算连接高层语义与 LLVM IR 的关键桥梁。

#python#android#开发语言
常见GPU通信库深度解读

场景用哪个原因大模型数据并行训练的梯度同步规则、大块、全员参与MoE的专家路由分发选择性分发、细粒度模型并行中的张量切分通信规则集合通信稀疏图神经网络的邻居聚合不规则、动态目标分布式数据加载的Broadcast一对多规则分发规则的大块传输交给RCCL,不规则的细粒度One-Sided访问交给NVSHMEM。两个库不是"你死我活"的关系,而是各管一摊、互相配合。千卡集群上跑大模型训练,两个都得搞明白

#人工智能
LightOP高阶算子库深度解读

能融合的都融合了:Reduce类算子3合1、大模型算子9合1——减少的是kernel launch开销和中间结果的显存读写,这些都是"看不见的耗时"该分开的都分开了:Prefill和Decoding走不同的实现路径,访存密集型和计算密集型各用各的优化策略——没有"一刀切"量化不只是精度换速度:SmoothQuant、W4A8重排压缩、多级流水掩盖——这是一套完整的量化部署方案,不只是把FP16换成

#人工智能#算法#机器学习
花几十万买加速卡,利用率不到50%?拆解海光DAS如何把国产DCU性能榨干

回到最实际的问题:如果你的团队在考虑国产化AI平台迁移,DAS值不值得投入?300+模型适配验证,拿来就能用,适配周期大幅缩短万卡集群验证通过,不只是小规模Demo,能上生产系统工程优化扎实,不是"能跑就行"的水平容器镜像 + FastPT工具链,工程化程度不错OpenDAS开源 + 版本快速迭代,生态在加速生长算子覆盖率跟CUDA生态还有数量级差距,LightOP 50+ vs CUDA数万Py

#人工智能
    共 78 条
  • 1
  • 2
  • 3
  • 8
  • 请选择