花几十万买加速卡,利用率不到50%?拆解海光DAS如何把国产DCU性能榨干
花几十万买加速卡,利用率不到50%?拆解海光DAS如何把国产DCU性能榨干
去年帮一个实验室迁移模型到国产平台,PyTorch代码跑通了,一看GPU利用率——39%。查了三天,问题出在算子实现和通信策略上。那时候我就在想:国产AI基础软件到底行不行?
一年后再看,情况变了。海光的DAS(DCU AI Software Stack)已经把数百个主流大模型适配完毕,大规模集群跑通了大参数模型的收敛验证。这篇文章基于DAS最新公开技术资料,从三层架构到六大系统工程优化,把DAS的技术栈拆开看看——它到底做了什么,能让DCU在AI场景下跟NV掰手腕。
目录
- 一、大模型把基础设施逼到了墙角
- 二、DAS三层架构:一句话讲清楚它在干什么
- 三、基础算子层:跑得快不快,全看这一层
- 四、框架工具层:别让适配吃掉你的工期
- 五、扩展组件层:训练和推理的实操拆解
- 六、六大系统工程优化:这才是DAS的真正壁垒
- 七、生态版图:数百模型适配意味着什么
- 八、生态发展与硬件演进
- 九、总结:DAS值不值得投入?
一、大模型把基础设施逼到了墙角
做AI infra的同行这几年都不太好过。原因很简单:
模型迭代太快了。 以前半年一个版本,现在有些团队一周一版。GLM-5参数从3550亿翻到7440亿。架构还在变——Dense转MoE已经是不争的趋势。基础设施团队刚把上一代模型优化好,下一代又来了。
硬件利用率上不去。 不管是进口的还是国产的加速卡,裸跑PyTorch利用率能做到60%都算不错。剩下的算力去哪了?显存带宽吃满了,算子没调优,通信等待占了大量时间。
国产化迁移不是"改几行代码"的事。 模型的算子在CUDA上有现成的,换到国产硬件上可能根本就没有对应实现。就算有,精度和性能也未必过关。
说白了,AI算法和国产硬件之间有一道很深的鸿沟。DAS就是填这道沟的东西。

二、DAS三层架构:一句话讲清楚它在干什么
DAS的全称是DCU AI Software Stack,定位很直接——连接AI算法与DCU硬件的中间层。如果你熟悉NVIDIA生态,可以粗暴类比:DAS ≈ CUDA + cuDNN + TensorRT + NCCL的集合体,只是专门为海光DCU定制的。
三层结构从上到下是这样的——据超算互联网DAS介绍页及百度百科"海光DCU软件栈"公开资料,DAS架构分为基础算子层、框架工具层和扩展组件层:
┌─────────────────────────────────────────────────────────┐
│ 扩展组件层 │
│ 训练:Apex / DeepSpeed / Megatron / FlashAttention / │
│ TransformerEngine / FastMoE / Bitsandbytes │
│ 推理:vLLM / SGLang / FlashMLA / LMSlim / KTransformers │
├─────────────────────────────────────────────────────────┤
│ 框架工具层 │
│ PyTorch │ TensorFlow │ JAX │ PaddlePaddle │
│ FastPT快速适配 │ LayerCheck精度检测 │
│ ONNXRuntime │ MIGraphX │ AI编译器(Triton/TVM/XLA) │
├─────────────────────────────────────────────────────────┤
│ 基础算子层 │
│ │ LightOP融合算子库 │ HYTLASS算子模板库 │
├─────────────────────────────────────────────────────────┤
│ DCU硬件 + DTK │
└─────────────────────────────────────────────────────────┘
DAS打出了三张牌:Coverage(全场景覆盖)、Performance(对标NV同级水平)、Agility + OpenDAS(快速迭代 + 开源开放)。三个词说起来轻巧,每一张牌背后都是实打实的工程量。
三、基础算子层:跑得快不快,全看这一层
基础算子层是DAS的地基。你上层框架再花哨,底层算子没优化好,利用率就是上不去。DAS在这一层押注了两个自研库:LightOP和HYTLASS。据百度百科介绍,DAS集成超2000个算子,通过算子调优、编译优化等技术充分发挥芯片算力。
3.1 LightOP:融合才是王道
LightOP是DAS自研的高性能融合算子库,覆盖大模型训练和推理的主流计算场景。
它要解决的核心问题就一个:减少显存读写次数。举个例子,传统写法下,LayerNorm → Linear → GELU 这三个操作是串行的,中间结果要反复在显存上搬来搬去。LightOP把它们融合成一个kernel调用:
import lightop as lop
# 一次调用完成 LayerNorm + Linear + GELU
output = lop.fused_ln_linear_gelu(
input_tensor,
ln_weight, ln_bias,
linear_weight, linear_bias
)
除了算子融合,LightOP还支持多精度量化——w4a8、w4a16、w8a8,以及channel-wise和block-wise量化方案。还有个比较有意思的特性叫TP通算融合,把Tensor Parallel里的计算和通信重叠执行,后面第六章会细说。
个人用下来的感受:融合算子对大模型推理的效果立竿见影,训练场景则要具体看模型结构和batch size。
3.2 HYTLASS:对标CUTLASS,但不是照抄
HYTLASS的核心理念跟NVIDIA的CUTLASS一脉相承——把GEMM这类计算密集型操作的"数据搬运"和"层次化结构"抽象成可复用的C++模板组件,在编译期就把最优实现确定下来。但它不是照抄,而是针对DCU的硬件特性做了重新设计。
目前HYTLASS支持CUTLASS 2.x/3.x及CuTe编程模型的对标实现,已经产出了FlashAttention、FlashMLA、DeepGEMM、FLUX等典型算子的高性能版本。
HYTLASS对开发者最大意义是:你不用每次手写底层kernel,用它的模板拼就行了。当然,模板拼出来的性能想追平手写极致优化版,还有一段路要走。
3.3 AI编译器适配:Triton on DCU
DAS在DCU上适配了Triton、TVM、XLA、TileLang等编译器。Triton这条线的进展值得关注:
- DCU TensorCore和FP8指令已经支持
- FlagGems算子适配通过FlagTree合入开源
- 重点算子的PASS优化在推进
import triton
import triton.language as tl
@triton.jit
def fused_attention_kernel(Q, K, V, output, ...):
# 在DCU上自动利用TensorCore加速矩阵乘法
...
Triton on DCU的高级特性(某些PASS优化)还不是全部可用。建议动手前先查DAS Release Note里的算子兼容性列表,别像我以前一样上来就写代码然后发现不支持。
四、框架工具层:别让适配吃掉你的工期
这一层的核心任务是把主流AI框架搬到DCU上跑通,同时提供工具降低适配成本。
当前支持的框架矩阵(据公开资料,DAS深度适配PyTorch、TensorFlow等主流框架):
| 组件 | 备注 |
|---|---|
| PyTorch | 主力框架,DCU后端深度优化 |
| TensorFlow | 兼容支持 |
| JAX | 函数式框架支持 |
| PaddlePaddle | 国产框架适配 |
| ONNX Runtime | 通用推理引擎 |
| MIGraphX | 推理引擎DCU适配 |
想单独说下 FastPT。这个工具解决了一个很实际的痛点:PyTorch三方组件怎么快速迁移到DCU?
以前的做法是手动改代码、替换算子、反复调试——一个组件搞一两周很正常。FastPT把这个过程自动化了,目前已支持数十款组件的快速适配。高阶用户还能自主编译安装,灵活性不错。
五、扩展组件层:训练和推理的实操拆解
扩展组件层是直接面向AI任务执行的一层。训练侧和推理侧的需求完全不同,DAS分别对待。
5.1 训练组件:大模型收敛验证是怎么跑通的
训练侧核心组件:
| 组件 | 干什么用 |
|---|---|
| DeepSpeed | 分布式训练 + ZeRO优化 |
| Megatron-LM | 大模型并行训练框架 |
| TransformerEngine | FP8训练加速 |
| FlashAttention | 高效注意力计算 |
| Bitsandbytes | 量化训练 |
| FastMoE | MoE模型高效训练 |
| Apex | 混合精度训练 |
DAS在训练效率上的优化思路是"多条腿走路":
训练效率提升
├── 并行策略
│ ├── 数据并行
│ ├── 张量并行 + 流水线并行
│ ├── 专家并行(DeepEP for MoE)
│ └── 多维混合并行
├── 内存优化
│ ├── 异步CPU-Offload
│ ├── 算子融合
│ ├── FP8/INT8 低精度训练
│ └── 重计算(Recomputation)
├── 计算效率
│ ├── 量化通信
│ ├── TP通算融合
│ └── MoE A2A Overlap
└── 规模验证
├── 超大集群扩展性验证
└── 万卡集群大参数模型收敛性验证
关键进展:万卡集群上跑通了大参数模型的预训练收敛验证,以及超大集群的扩展性验证。据电子产品世界2026年4月报道,海光DCU软件栈万卡集群强扩展效率达99.63%,支撑万亿参数大模型训练。这说明DAS不是实验室里的小打小闹,而是确实能在万卡级别集群上干活。
5.2 推理组件:vLLM + SGLang两条腿走路
大模型推理就一个核心矛盾:延迟、吞吐、成本不可能三角。DAS的解法:
| 组件 | 核心优化点 |
|---|---|
| vLLM | PageAttention + Continuous Batching |
| SGLang | 结构化生成优化 |
| FlashMLA | Multi-head Latent Attention |
| LMSlim | 模型压缩与量化 |
| KTransformers | 异构推理加速 |
vLLM是当前推理部署的事实标准之一。PageAttention把KV Cache按页管理,消除了显存碎片;Continuous Batching做到请求级别的动态批处理,吞吐直接拉满。
SGLang则偏向结构化生成场景,比如让模型输出JSON、代码等格式化的内容。两条线并行推进,覆盖不同的推理需求。
推理量化方案也比较全:int8、w8a8、w4a16、w4a8都支持,KV-Cache量化也有。
六、六大系统工程优化:这才是DAS的真正壁垒
如果说前面三层是"零件",那系统工程优化就是"把这堆零件装配好,跑出最高效率"的能力。DAS在这方面下了血本。
6.1 ZeRO显存优化
DeepSpeed的ZeRO方案把优化器状态、梯度、参数分片到多张卡上,单卡显存需求大幅降低。DAS在DCU上完整支持ZeRO-3,实测能训练远超单卡容量的模型。
怎么理解这个效果?ZeRO-3下,一个原本需要8张卡才能装下的模型,可能4张卡就够了。省下的不只是显存,还有实打实的硬件成本。
6.2 FlashAttention / FlashDecoding
把Attention计算的显存复杂度从O(N²)降到分块级别。这不是DAS的原创,但DAS在DCU上把这个优化做了深度实现。配合长序列场景,性能提升明显。
6.3 PageAttention + Continuous Batching
vLLM的两大杀器。PageAttention的思路很朴素:KV Cache别按序列连续分配,像操作系统的虚拟内存一样分页管理,用多少占多少,消除碎片。
Continuous Batching更进一步——传统批处理要等整个batch一起完成,Continuous Batching允许请求随时加入和退出batch。实测吞吐比静态batching高三四十个百分点不成问题。
6.4 量化通信
分布式训练中通信经常是瓶颈。量化通信的思路很直接:把要传的梯度或激活值先量化到int8甚至int4,传过去再反量化:
bf16 → quantize → int8/int4 → all2all → dequantize → 恢复精度
以精度换带宽。在MoE模型的All-to-All通信场景下效果尤其明显。
6.5 TP通算融合
Tensor Parallel的执行模式天然有计算和通信交替的pattern。TP通算融合的做法是:算第一个micro-batch的时候,通信第二个micro-batch的数据,把等待时间"藏"到计算里。
这个优化对流水线并行场景的提升最明显,因为这类场景下通信延迟往往就是性能天花板。
6.6 多维并行系统
数据并行、张量并行、流水线并行、专家并行——四种策略DAS都支持,而且可以混合编排。不同模型、不同集群拓扑下的最优组合不一样,DAS提供了灵活的策略配置。
七、生态版图:数百模型适配意味着什么
OpenDAS:数十组件开源
OpenDAS整合了数十个经过验证的PyTorch三方组件,涵盖视觉、3D、分布式、量化、音频等领域:
| 类别 | 组件举例 |
|---|---|
| 视觉 | Vision, MMCV, Detectron2, MMDetection3D, OpenCV |
| 3D | PyTorch3D, OpenPCDet, SparseConvNet |
| 分布式 | DeepSpeed, Megatron-LM, FastMoE, FairScale |
| 量化 | Bitsandbytes, LMSlim |
| 音频 | Audio, FastRNNT |
| 其他 | Ollama, KTransformers, FairSeq, OpenFold, DRTK |
容器镜像:省掉半天环境配置
搞AI的都懂,环境配置是隐藏时间杀手。DAS提供了预封装镜像:vLLM推理、PyTorch训练(带JupyterLab)、TensorFlow、MIGraphX、VSCode-OneFlow开发镜像,从光源镜像仓库直接拉下来就能用。
光源Model Zoo:数百模型已经调通
这可能是DAS生态中最有说服力的部分。数百个主流大模型已在DCU上完成适配验证,覆盖国内外主流大模型系列。据今日头条2026年5月报道,DAS集成2000+ AI算子,深度适配PyTorch/TensorFlow/VLLM等框架,实现数百个模型零代码迁移。
已适配模型覆盖国内外主流厂商系列,包括但不限于:
- 阿里通义千问:Qwen系列 / Qwen2.x / QwQ / Qwen3.0
- DeepSeek:DeepSeek-V2/V3 / R1 / R1-Distill / Coder / VL
- Meta Llama:Llama全系列 / Code Llama
- 智谱清言:ChatGLM系列 / GLM-130B / GLM4 / CodeGeeX / CogVLM
- 零一万物:Yi系列 / Yi-VL
- 书生·浦语:InternLM系列
- 百度文心:ERNIE系列
- 百川智能:Baichuan系列
- 腾讯:VITA系列 / Hunyuan系列
- Google:Gemma系列
- Stability AI:Stable Diffusion系列 / FLUX / XL
以及其他多家厂商的主力模型系列。模型涵盖语言大模型、多模态大模型、视觉大模型、代码大模型等类别,拿来即用,无需从头适配。据百度百科,海光DCU已在20多个行业、300多个场景实现应用。
数百模型适配这个数字意味着:绝大部分主流模型拿来就能跑,不需要从头适配。对做国产化迁移的团队来说,这一点比什么架构图都有说服力。
八、生态发展与硬件演进
DAS保持着紧凑的版本迭代节奏,每年推出多个版本,依次实现:新硬件平台支持、软件深度适配优化、关键项目覆盖支撑,以及面向TOP用户的全面投入——框架组件支持规模持续扩大。据电子产品世界2026年4月报道,海光DCU软件栈采用DTK→DS→DAP三层架构,全面对标国际主流生态,实现从硬件、基础软件、AI框架到应用平台的全栈升级。
硬件侧同样持续演进。DCU系列加速卡历经多代发展,从首颗国产GPGPU起步,逐步增加张量计算单元、升级互联总线、扩大显存容量。最新一代产品已支持FP8精度,AI算力大幅提升,并通过HYSwitch互联总线实现高效多卡协同,性能对标国际旗舰水平。
DAS的软件迭代和DCU的硬件迭代是咬合前进的——硬件给算力底座,软件把算力转化为实际可用性能。这一套"软硬协同"的打法,跟NV的CUDA生态演进逻辑本质上是一样的。
九、总结:DAS值不值得投入?
回到最实际的问题:如果你的团队在考虑国产化AI平台迁移,DAS值不值得投入?
先说好的方面:
- 数百模型适配验证,拿来就能用,适配周期大幅缩短
- 万卡集群验证通过(据电子产品世界报道,强扩展效率达99.63%),不只是小规模Demo,能上生产
- 系统工程优化扎实,不是"能跑就行"的水平
- 容器镜像 + FastPT工具链,工程化程度不错
- OpenDAS开源 + 版本快速迭代,生态在加速生长
再说不够的:
- 算子覆盖率跟CUDA生态还有数量级差距,LightOP数十个 vs CUDA数万
- PyTorch版本追得气喘吁吁,社区一个版本出来,DAS适配要滞后一段时间
- 文档、社区、调试工具这些"软实力"还在补课
- Triton等编译器的高级特性支持不是全量,开发时会遇到兼容性坑
我的判断: DAS已经从"勉强能用"走到了"能打"的阶段。如果你是那种"必须现在立刻马上用国产平台跑大模型"的团队,DAS是目前最务实的路径之一。如果你团队在CUDA上有大量定制算子,迁移成本会比较大,建议先从推理场景切入,再逐步推进到训练。
大模型时代,算力自主可控已经不是一个可选项。在硬件被卡脖子的背景下,DAS这样的基础软件层做得越扎实,国产AI生态的底子就越厚。
参考资料:
- 海光DCU人工智能基础软件系统(DAS)公开技术资料
- 百度百科"海光DCU软件栈":https://baike.baidu.com/item/海光DCU软件栈/67914285
- 电子产品世界《海光信息:以芯片内生安全与万卡算力底座,重塑AI时代算力安全新格局》(2026年4月):https://www.eepw.com.cn/article/202604/480525.htm
- 超算互联网DAS介绍页:https://www.scnet.cn/help/docs/mainsite/ai/appendix/DAS-introduction/index.html
相关资源:
- DAS资源下载平台:框架组件、算子库各版本下载
- 光合开发者社区:文档中心、在线课程、开源项目案例
- OpenDAS开源组件库:数十款DCU适配三方组件源码
本文基于海光DAS最新公开技术资料撰写,部分技术细节可能随版本迭代更新。
更多推荐


所有评论(0)