logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

CANN 里那个让大模型推理快了3倍的算子,到底做了

CANN 里那个让大模型推理快了3倍的算子,到底做了什么

文章图片
#windows
大模型训练配方:分布式训练与混合精度实战

大模型的参数规模从数亿到数千亿不等,单卡显存已无法容纳完整的模型状态。分布式训练成为支撑百亿参数模型落地的关键技术,而混合精度训练则在保证数值稳定性的前提下显著降低显存占用与计算耗时。昇腾CANN(Compute Architecture for Neural Networks)提供了完整的分布式训练能力集,涵盖数据并行、模型并行、流水线并行等多种并行策略,并原生支持混合精度训练流程。

文章图片
#分布式
torchtitan-npu:大模型预训练在昇腾上的分布式执行链路与 Checkpoint 优化

大模型预训练的工程复杂度不仅来自模型本身的参数规模,更来自分布式训练过程中跨设备通信、计算资源调度、以及训练状态持久化(Checkpoint)带来的系统性开销。torchtitan 是 PyTorch 官方提供的大模型预训练参考实现,基于原生 PyTorch 分布式接口构建,支持 FSDP(Fully Sharded Data Parallel)与张量并行(Tensor Parallel)等主流并

文章图片
#分布式
torchtitan-npu:大模型预训练在昇腾上的分布式执行链路与 Checkpoint 优化

大模型预训练的工程复杂度不仅来自模型本身的参数规模,更来自分布式训练过程中跨设备通信、计算资源调度、以及训练状态持久化(Checkpoint)带来的系统性开销。torchtitan 是 PyTorch 官方提供的大模型预训练参考实现,基于原生 PyTorch 分布式接口构建,支持 FSDP(Fully Sharded Data Parallel)与张量并行(Tensor Parallel)等主流并

文章图片
#分布式
torchtitan-npu:大模型预训练在昇腾上的分布式执行链路与 Checkpoint 优化

大模型预训练的工程复杂度不仅来自模型本身的参数规模,更来自分布式训练过程中跨设备通信、计算资源调度、以及训练状态持久化(Checkpoint)带来的系统性开销。torchtitan 是 PyTorch 官方提供的大模型预训练参考实现,基于原生 PyTorch 分布式接口构建,支持 FSDP(Fully Sharded Data Parallel)与张量并行(Tensor Parallel)等主流并

文章图片
#分布式
torchtitan-npu:大模型预训练在昇腾上的分布式执行链路与 Checkpoint 优化

大模型预训练的工程复杂度不仅来自模型本身的参数规模,更来自分布式训练过程中跨设备通信、计算资源调度、以及训练状态持久化(Checkpoint)带来的系统性开销。torchtitan 是 PyTorch 官方提供的大模型预训练参考实现,基于原生 PyTorch 分布式接口构建,支持 FSDP(Fully Sharded Data Parallel)与张量并行(Tensor Parallel)等主流并

文章图片
#分布式
asnumpy:NumPy 语义在 NPU 上的零拷贝实现与算子映射机制

NumPy 作为 Python 科学计算生态系统的基石,其数组抽象与向量化运算范式深刻影响了后续每一代数值计算框架的设计。随着 AI 训练与推理负载逐步从 CPU 向 NPU 迁移,如何在保持 NumPy 编程语义的同时,将底层数据零拷贝地映射到昇腾 NPU 的异构内存体系,成为连接传统科学计算与新一代 AI 加速芯片的关键工程问题。

文章图片
#numpy
asnumpy:NumPy 语义在 NPU 上的零拷贝实现与算子映射机制

NumPy 作为 Python 科学计算生态系统的基石,其数组抽象与向量化运算范式深刻影响了后续每一代数值计算框架的设计。随着 AI 训练与推理负载逐步从 CPU 向 NPU 迁移,如何在保持 NumPy 编程语义的同时,将底层数据零拷贝地映射到昇腾 NPU 的异构内存体系,成为连接传统科学计算与新一代 AI 加速芯片的关键工程问题。

文章图片
#numpy
asnumpy:NumPy 语义在 NPU 上的零拷贝实现与算子映射机制

NumPy 作为 Python 科学计算生态系统的基石,其数组抽象与向量化运算范式深刻影响了后续每一代数值计算框架的设计。随着 AI 训练与推理负载逐步从 CPU 向 NPU 迁移,如何在保持 NumPy 编程语义的同时,将底层数据零拷贝地映射到昇腾 NPU 的异构内存体系,成为连接传统科学计算与新一代 AI 加速芯片的关键工程问题。

文章图片
#numpy
TensorFlow 框架适配层:从 GraphDef 到昇腾 CANN 算子的映射机制深度解析

随着人工智能技术的快速发展,深度学习框架与硬件加速器之间的适配成为关键技术挑战。TensorFlow 作为主流的深度学习框架,其计算图表示形式 GraphDef 与昇腾 CANN(Compute Architecture for Neural Networks)算子体系之间存在显著的语义差异。本文深入解析 TensorFlow 框架适配层的核心机制,详细阐述从 TensorFlow GraphDe

文章图片
#neo4j
    共 48 条
  • 1
  • 2
  • 3
  • 4
  • 5
  • 请选择