
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
受此前低精度训练优势的启发,文章提出了使用FP8数据格式的细粒度混合精度框架用于DeepSeek-V3的训练。尽管低精度训练有巨大的潜力,但经常被激活值、权重、梯度的异常值限制。虽然在推理量化上已经有重大进步,但是低精度技术在大规模语言模型预训练中的成功应用相对较少。为了应对这一挑战并且有效地拓宽FP8格式的动态范围,文章引入了细粒度量化策略:切片分组和分块分组量化。在提高累加精度。
这篇文档主要从原理出发,介绍DeepSeek-V3的关键模型结构。由于DeepSeek-V3的结构是一个持续演进的过程,所以本文首先会简单介混合专家模型(MoE)的基本结构,然后沿着DeepSeek-MoE、DeepSeek-V2和DeepSeek-V3的顺序逐步介绍关键的模型结构。近几年的研究和实践表明训练数据和模型规模的增大能显著增强模型的能力。但是大规模的模型训练也会导致极高的算力成本。为了
首先回顾一下标准的多头注意力机制(Multi-Head Attention,MHA),在标准的多头注意力机制下,首先需要根据隐状态ht分别计算计算qtktvtqtWQhtktWKhtvtWVht其中,ht∈Rd是attention层第t个token对应的输入,d是embedding的维度;qtktvt∈Rdhnhdh和nh。
在 AI 计算场景中,算子的执行效率直接影响模型训练与推理的整体性能。Ascend C 作为面向昇腾 AI 处理器的算子开发语言,提供了丰富的编程接口与硬件抽象能力。然而,要充分发挥硬件潜力,开发者需要系统性地识别并消除性能瓶颈。本文从搬运、内存、API 使用、流水、Tiling 及头开销等六大方向出发,结合实际案例,总结了一套可复用的性能优化方法论,帮助开发者快速定位问题并实施有效优化。
在 AI 计算场景中,算子的执行效率直接影响模型训练与推理的整体性能。Ascend C 作为面向昇腾 AI 处理器的算子开发语言,提供了丰富的编程接口与硬件抽象能力。然而,要充分发挥硬件潜力,开发者需要系统性地识别并消除性能瓶颈。本文从搬运、内存、API 使用、流水、Tiling 及头开销等六大方向出发,结合实际案例,总结了一套可复用的性能优化方法论,帮助开发者快速定位问题并实施有效优化。
从GM读取数据方法错误:在`Init`中需要直接从GM中读取`rowPtr`以计算`startValIdx`和`endValIdx`,这个步骤在`SetGlobalBuffer`之前,而`GM_ADDR`的类型是,因此需要`reinterpret_cast<__gm__ uint32_t*>(rowPtr)`强转后读取,否则读取出来的数据错误导致精度问题。对于每一行,执行`CopyIn` -> `







