花几十万买加速卡,利用率不到50%?拆解海光DAS如何把国产DCU性能榨干

去年帮一个实验室迁移模型到国产平台,PyTorch代码跑通了,一看GPU利用率——39%。查了三天,问题出在算子实现和通信策略上。那时候我就在想:国产AI基础软件到底行不行?

一年后再看,情况变了。海光的DAS(DCU AI Software Stack)已经把数百个主流大模型适配完毕,大规模集群跑通了大参数模型的收敛验证。这篇文章基于DAS最新公开技术资料,从三层架构到六大系统工程优化,把DAS的技术栈拆开看看——它到底做了什么,能让DCU在AI场景下跟NV掰手腕。


目录


一、大模型把基础设施逼到了墙角

做AI infra的同行这几年都不太好过。原因很简单:

模型迭代太快了。 以前半年一个版本,现在有些团队一周一版。GLM-5参数从3550亿翻到7440亿。架构还在变——Dense转MoE已经是不争的趋势。基础设施团队刚把上一代模型优化好,下一代又来了。

硬件利用率上不去。 不管是进口的还是国产的加速卡,裸跑PyTorch利用率能做到60%都算不错。剩下的算力去哪了?显存带宽吃满了,算子没调优,通信等待占了大量时间。

国产化迁移不是"改几行代码"的事。 模型的算子在CUDA上有现成的,换到国产硬件上可能根本就没有对应实现。就算有,精度和性能也未必过关。

说白了,AI算法和国产硬件之间有一道很深的鸿沟。DAS就是填这道沟的东西。

在这里插入图片描述


二、DAS三层架构:一句话讲清楚它在干什么

DAS的全称是DCU AI Software Stack,定位很直接——连接AI算法与DCU硬件的中间层。如果你熟悉NVIDIA生态,可以粗暴类比:DAS ≈ CUDA + cuDNN + TensorRT + NCCL的集合体,只是专门为海光DCU定制的。

生态周边

光源-镜像仓库

光源-Model Zoo(数百模型)

DCU 硬件基础设施 + DTK

DCU系列加速卡

DTK开发工具栈

DAS 人工智能基础软件系统

基础算子层

LightOP融合算子库

HYTLASS算子模板库

AI编译: Triton / XLA / TVM / TileLang

框架工具层

PyTorch | TensorFlow | JAX | PaddlePaddle

FastPT快速适配 | LayerCheck精度检测

ONNXRuntime | MIGraphX | AI编译器(Triton/TVM/XLA)

扩展组件层

训练: Apex / DeepSpeed / Megatron / FlashAttention / TransformerEngine / FastMoE / Bitsandbytes

推理: vLLM / SGLang / FlashMLA / LMSlim / KTransformers

大模型 & 应用层

语言大模型

多模态大模型

视觉大模型

视频生成大模型

RAG / 具身智能 / 自动驾驶

三层结构从上到下是这样的——据超算互联网DAS介绍页及百度百科"海光DCU软件栈"公开资料,DAS架构分为基础算子层、框架工具层和扩展组件层:

┌─────────────────────────────────────────────────────────┐
│                    扩展组件层                             │
│  训练:Apex / DeepSpeed / Megatron / FlashAttention /    │
│        TransformerEngine / FastMoE / Bitsandbytes        │
│  推理:vLLM / SGLang / FlashMLA / LMSlim / KTransformers │
├─────────────────────────────────────────────────────────┤
│                    框架工具层                             │
│  PyTorch │ TensorFlow │ JAX │ PaddlePaddle              │
│  FastPT快速适配 │ LayerCheck精度检测                      │
│  ONNXRuntime │ MIGraphX │ AI编译器(Triton/TVM/XLA)       │
├─────────────────────────────────────────────────────────┤
│                    基础算子层                             │
│  │ LightOP融合算子库  │ HYTLASS算子模板库                 │
├─────────────────────────────────────────────────────────┤
│                DCU硬件 + DTK                             │
└─────────────────────────────────────────────────────────┘

DAS打出了三张牌:Coverage(全场景覆盖)、Performance(对标NV同级水平)、Agility + OpenDAS(快速迭代 + 开源开放)。三个词说起来轻巧,每一张牌背后都是实打实的工程量。


三、基础算子层:跑得快不快,全看这一层

基础算子层是DAS的地基。你上层框架再花哨,底层算子没优化好,利用率就是上不去。DAS在这一层押注了两个自研库:LightOP和HYTLASS。据百度百科介绍,DAS集成超2000个算子,通过算子调优、编译优化等技术充分发挥芯片算力。

3.1 LightOP:融合才是王道

LightOP是DAS自研的高性能融合算子库,覆盖大模型训练和推理的主流计算场景。

它要解决的核心问题就一个:减少显存读写次数。举个例子,传统写法下,LayerNorm → Linear → GELU 这三个操作是串行的,中间结果要反复在显存上搬来搬去。LightOP把它们融合成一个kernel调用:

import lightop as lop

# 一次调用完成 LayerNorm + Linear + GELU
output = lop.fused_ln_linear_gelu(
    input_tensor,
    ln_weight, ln_bias,
    linear_weight, linear_bias
)

除了算子融合,LightOP还支持多精度量化——w4a8、w4a16、w8a8,以及channel-wise和block-wise量化方案。还有个比较有意思的特性叫TP通算融合,把Tensor Parallel里的计算和通信重叠执行,后面第六章会细说。

个人用下来的感受:融合算子对大模型推理的效果立竿见影,训练场景则要具体看模型结构和batch size。

3.2 HYTLASS:对标CUTLASS,但不是照抄

HYTLASS的核心理念跟NVIDIA的CUTLASS一脉相承——把GEMM这类计算密集型操作的"数据搬运"和"层次化结构"抽象成可复用的C++模板组件,在编译期就把最优实现确定下来。但它不是照抄,而是针对DCU的硬件特性做了重新设计。

目前HYTLASS支持CUTLASS 2.x/3.x及CuTe编程模型的对标实现,已经产出了FlashAttention、FlashMLA、DeepGEMM、FLUX等典型算子的高性能版本。

HYTLASS对开发者最大意义是:你不用每次手写底层kernel,用它的模板拼就行了。当然,模板拼出来的性能想追平手写极致优化版,还有一段路要走。

3.3 AI编译器适配:Triton on DCU

DAS在DCU上适配了Triton、TVM、XLA、TileLang等编译器。Triton这条线的进展值得关注:

  • DCU TensorCore和FP8指令已经支持
  • FlagGems算子适配通过FlagTree合入开源
  • 重点算子的PASS优化在推进
import triton
import triton.language as tl

@triton.jit
def fused_attention_kernel(Q, K, V, output, ...):
    # 在DCU上自动利用TensorCore加速矩阵乘法
    ...

Triton on DCU的高级特性(某些PASS优化)还不是全部可用。建议动手前先查DAS Release Note里的算子兼容性列表,别像我以前一样上来就写代码然后发现不支持。


四、框架工具层:别让适配吃掉你的工期

这一层的核心任务是把主流AI框架搬到DCU上跑通,同时提供工具降低适配成本。

当前支持的框架矩阵(据公开资料,DAS深度适配PyTorch、TensorFlow等主流框架):

组件 备注
PyTorch 主力框架,DCU后端深度优化
TensorFlow 兼容支持
JAX 函数式框架支持
PaddlePaddle 国产框架适配
ONNX Runtime 通用推理引擎
MIGraphX 推理引擎DCU适配

想单独说下 FastPT。这个工具解决了一个很实际的痛点:PyTorch三方组件怎么快速迁移到DCU?

以前的做法是手动改代码、替换算子、反复调试——一个组件搞一两周很正常。FastPT把这个过程自动化了,目前已支持数十款组件的快速适配。高阶用户还能自主编译安装,灵活性不错。

基础算子 & 框架支撑

LightOP 融合算子

HYTLASS 模板库

Triton / XLA / TVM

FastPT / LayerCheck

BLAS / DNN / RCCL

系统工程优化能力

通用优化能力

访存优化 / Layout优化

多精度 / Overlap

Topo优化 / 多维分布式

ReComputing / Dynamic Shape

Pass优化 / Fused Op

推理能力

通用模型推理
ORT / MIGraphX / AIT

大模型推理
vLLM / TGI / SGLang

FlashAttention / FlashDecoding

Continuous Batching

PageAttention / KV Cache

训练能力

通用模型训练

大模型训练

Optimizer优化

剪枝 / 蒸馏 / 量化

模型压缩 / 稀疏


五、扩展组件层:训练和推理的实操拆解

扩展组件层是直接面向AI任务执行的一层。训练侧和推理侧的需求完全不同,DAS分别对待。

5.1 训练组件:大模型收敛验证是怎么跑通的

训练侧核心组件:

组件 干什么用
DeepSpeed 分布式训练 + ZeRO优化
Megatron-LM 大模型并行训练框架
TransformerEngine FP8训练加速
FlashAttention 高效注意力计算
Bitsandbytes 量化训练
FastMoE MoE模型高效训练
Apex 混合精度训练

DAS在训练效率上的优化思路是"多条腿走路":

训练效率提升
├── 并行策略
│   ├── 数据并行
│   ├── 张量并行 + 流水线并行
│   ├── 专家并行(DeepEP for MoE)
│   └── 多维混合并行
├── 内存优化
│   ├── 异步CPU-Offload
│   ├── 算子融合
│   ├── FP8/INT8 低精度训练
│   └── 重计算(Recomputation)
├── 计算效率
│   ├── 量化通信
│   ├── TP通算融合
│   └── MoE A2A Overlap
└── 规模验证
    ├── 超大集群扩展性验证
    └── 万卡集群大参数模型收敛性验证

关键进展:万卡集群上跑通了大参数模型的预训练收敛验证,以及超大集群的扩展性验证。据电子产品世界2026年4月报道,海光DCU软件栈万卡集群强扩展效率达99.63%,支撑万亿参数大模型训练。这说明DAS不是实验室里的小打小闹,而是确实能在万卡级别集群上干活。

规模验证

超大集群扩展性验证

万卡集群大参数模型
收敛性验证

计算效率

量化通信

TP通算融合

MoE A2A Overlap

内存优化

异步CPU-Offload

算子融合

FP8 / INT8 低精度训练

重计算(Recomputation)

并行策略

数据并行

张量并行 + 流水线并行

专家并行(DeepEP for MoE)

多维混合并行

DAS 大模型训练效率优化全景

5.2 推理组件:vLLM + SGLang两条腿走路

大模型推理就一个核心矛盾:延迟、吞吐、成本不可能三角。DAS的解法:

组件 核心优化点
vLLM PageAttention + Continuous Batching
SGLang 结构化生成优化
FlashMLA Multi-head Latent Attention
LMSlim 模型压缩与量化
KTransformers 异构推理加速

vLLM是当前推理部署的事实标准之一。PageAttention把KV Cache按页管理,消除了显存碎片;Continuous Batching做到请求级别的动态批处理,吞吐直接拉满。

SGLang则偏向结构化生成场景,比如让模型输出JSON、代码等格式化的内容。两条线并行推进,覆盖不同的推理需求。

推理量化方案也比较全:int8、w8a8、w4a16、w4a8都支持,KV-Cache量化也有。

编译与调度优化

计算图融合

Kernel调优

Zero-overhead调度

PD分离 / 图优化

算子加速

LightOP 融合算子

FlashAttention

FlashMLA

KTransformers
异构推理加速

量化推理

INT8 / W8A8

W4A16 / W4A8

KV-Cache量化

LMSlim
模型压缩与量化

推理引擎

vLLM
PageAttention + Continuous Batching

SGLang
结构化生成优化

MIGraphX
通用推理引擎

ONNX Runtime

DAS 大模型推理优化全景


六、六大系统工程优化:这才是DAS的真正壁垒

如果说前面三层是"零件",那系统工程优化就是"把这堆零件装配好,跑出最高效率"的能力。DAS在这方面下了血本。

6.1 ZeRO显存优化

DeepSpeed的ZeRO方案把优化器状态、梯度、参数分片到多张卡上,单卡显存需求大幅降低。DAS在DCU上完整支持ZeRO-3,实测能训练远超单卡容量的模型。

怎么理解这个效果?ZeRO-3下,一个原本需要8张卡才能装下的模型,可能4张卡就够了。省下的不只是显存,还有实打实的硬件成本。

6.2 FlashAttention / FlashDecoding

把Attention计算的显存复杂度从O(N²)降到分块级别。这不是DAS的原创,但DAS在DCU上把这个优化做了深度实现。配合长序列场景,性能提升明显。

优化为

DCU 实现效果

长序列场景
性能大幅提升

减少显存带宽压力

支撑更大 context length

FlashAttention / FlashDecoding

分块计算
Tiling

SRAM内完成
Softmax 增量计算

避免完整矩阵
写入显存

显存降到 O(N)

标准 Attention 计算

Q × K^T

Softmax

× V

O(N²) 显存复杂度

6.3 PageAttention + Continuous Batching

vLLM的两大杀器。PageAttention的思路很朴素:KV Cache别按序列连续分配,像操作系统的虚拟内存一样分页管理,用多少占多少,消除碎片。

Continuous Batching更进一步——传统批处理要等整个batch一起完成,Continuous Batching允许请求随时加入和退出batch。实测吞吐比静态batching高三四十个百分点不成问题。

6.4 量化通信

分布式训练中通信经常是瓶颈。量化通信的思路很直接:把要传的梯度或激活值先量化到int8甚至int4,传过去再反量化:

bf16 → quantize → int8/int4 → all2all → dequantize → 恢复精度

以精度换带宽。在MoE模型的All-to-All通信场景下效果尤其明显。

bf16 梯度/激活值

Quantize
量化

int8 / int4
压缩表示

All-to-All
通信传输

Dequantize
反量化

恢复 bf16 精度
继续计算

6.5 TP通算融合

Tensor Parallel的执行模式天然有计算和通信交替的pattern。TP通算融合的做法是:算第一个micro-batch的时候,通信第二个micro-batch的数据,把等待时间"藏"到计算里。

这个优化对流水线并行场景的提升最明显,因为这类场景下通信延迟往往就是性能天花板。

6.6 多维并行系统

数据并行、张量并行、流水线并行、专家并行——四种策略DAS都支持,而且可以混合编排。不同模型、不同集群拓扑下的最优组合不一样,DAS提供了灵活的策略配置。

规模验证

超大集群
扩展性验证

万卡集群
大参数模型收敛验证

混合编排

DP + TP + PP
3D并行

DP + EP
MoE场景

TP + PP
超大模型

全策略混合
万卡集群

四大并行策略

数据并行
Data Parallel

张量并行
Tensor Parallel

流水线并行
Pipeline Parallel

专家并行
Expert Parallel

DAS 多维并行系统


七、生态版图:数百模型适配意味着什么

OpenDAS:数十组件开源

OpenDAS整合了数十个经过验证的PyTorch三方组件,涵盖视觉、3D、分布式、量化、音频等领域:

类别 组件举例
视觉 Vision, MMCV, Detectron2, MMDetection3D, OpenCV
3D PyTorch3D, OpenPCDet, SparseConvNet
分布式 DeepSpeed, Megatron-LM, FastMoE, FairScale
量化 Bitsandbytes, LMSlim
音频 Audio, FastRNNT
其他 Ollama, KTransformers, FairSeq, OpenFold, DRTK

容器镜像:省掉半天环境配置

搞AI的都懂,环境配置是隐藏时间杀手。DAS提供了预封装镜像:vLLM推理、PyTorch训练(带JupyterLab)、TensorFlow、MIGraphX、VSCode-OneFlow开发镜像,从光源镜像仓库直接拉下来就能用。

光源Model Zoo:数百模型已经调通

这可能是DAS生态中最有说服力的部分。数百个主流大模型已在DCU上完成适配验证,覆盖国内外主流大模型系列。据今日头条2026年5月报道,DAS集成2000+ AI算子,深度适配PyTorch/TensorFlow/VLLM等框架,实现数百个模型零代码迁移。

已适配模型覆盖国内外主流厂商系列,包括但不限于:

  • 阿里通义千问:Qwen系列 / Qwen2.x / QwQ / Qwen3.0
  • DeepSeek:DeepSeek-V2/V3 / R1 / R1-Distill / Coder / VL
  • Meta Llama:Llama全系列 / Code Llama
  • 智谱清言:ChatGLM系列 / GLM-130B / GLM4 / CodeGeeX / CogVLM
  • 零一万物:Yi系列 / Yi-VL
  • 书生·浦语:InternLM系列
  • 百度文心:ERNIE系列
  • 百川智能:Baichuan系列
  • 腾讯:VITA系列 / Hunyuan系列
  • Google:Gemma系列
  • Stability AI:Stable Diffusion系列 / FLUX / XL

以及其他多家厂商的主力模型系列。模型涵盖语言大模型、多模态大模型、视觉大模型、代码大模型等类别,拿来即用,无需从头适配。据百度百科,海光DCU已在20多个行业、300多个场景实现应用。

数百模型适配这个数字意味着:绝大部分主流模型拿来就能跑,不需要从头适配。对做国产化迁移的团队来说,这一点比什么架构图都有说服力。


八、生态发展与硬件演进

DAS保持着紧凑的版本迭代节奏,每年推出多个版本,依次实现:新硬件平台支持、软件深度适配优化、关键项目覆盖支撑,以及面向TOP用户的全面投入——框架组件支持规模持续扩大。据电子产品世界2026年4月报道,海光DCU软件栈采用DTK→DS→DAP三层架构,全面对标国际主流生态,实现从硬件、基础软件、AI框架到应用平台的全栈升级。

硬件侧同样持续演进。DCU系列加速卡历经多代发展,从首颗国产GPGPU起步,逐步增加张量计算单元、升级互联总线、扩大显存容量。最新一代产品已支持FP8精度,AI算力大幅提升,并通过HYSwitch互联总线实现高效多卡协同,性能对标国际旗舰水平。

DAS的软件迭代和DCU的硬件迭代是咬合前进的——硬件给算力底座,软件把算力转化为实际可用性能。这一套"软硬协同"的打法,跟NV的CUDA生态演进逻辑本质上是一样的。


九、总结:DAS值不值得投入?

回到最实际的问题:如果你的团队在考虑国产化AI平台迁移,DAS值不值得投入?

先说好的方面:

  • 数百模型适配验证,拿来就能用,适配周期大幅缩短
  • 万卡集群验证通过(据电子产品世界报道,强扩展效率达99.63%),不只是小规模Demo,能上生产
  • 系统工程优化扎实,不是"能跑就行"的水平
  • 容器镜像 + FastPT工具链,工程化程度不错
  • OpenDAS开源 + 版本快速迭代,生态在加速生长

再说不够的:

  • 算子覆盖率跟CUDA生态还有数量级差距,LightOP数十个 vs CUDA数万
  • PyTorch版本追得气喘吁吁,社区一个版本出来,DAS适配要滞后一段时间
  • 文档、社区、调试工具这些"软实力"还在补课
  • Triton等编译器的高级特性支持不是全量,开发时会遇到兼容性坑

我的判断: DAS已经从"勉强能用"走到了"能打"的阶段。如果你是那种"必须现在立刻马上用国产平台跑大模型"的团队,DAS是目前最务实的路径之一。如果你团队在CUDA上有大量定制算子,迁移成本会比较大,建议先从推理场景切入,再逐步推进到训练。

大模型时代,算力自主可控已经不是一个可选项。在硬件被卡脖子的背景下,DAS这样的基础软件层做得越扎实,国产AI生态的底子就越厚。


参考资料

  • 海光DCU人工智能基础软件系统(DAS)公开技术资料
  • 百度百科"海光DCU软件栈":https://baike.baidu.com/item/海光DCU软件栈/67914285
  • 电子产品世界《海光信息:以芯片内生安全与万卡算力底座,重塑AI时代算力安全新格局》(2026年4月):https://www.eepw.com.cn/article/202604/480525.htm
  • 超算互联网DAS介绍页:https://www.scnet.cn/help/docs/mainsite/ai/appendix/DAS-introduction/index.html

相关资源

  • DAS资源下载平台:框架组件、算子库各版本下载
  • 光合开发者社区:文档中心、在线课程、开源项目案例
  • OpenDAS开源组件库:数十款DCU适配三方组件源码

本文基于海光DAS最新公开技术资料撰写,部分技术细节可能随版本迭代更新。

Logo

免费领 150 小时云算力,进群参与显卡、AI PC 幸运抽奖

更多推荐