
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
标准Attention太占显存。分块算、边算边扔、不存全局矩阵。在昇腾NPU上, ops-transformer 仓库里的 FlashAttention 算子,用Ascend CCube Core(矩阵乘法)Vector Core(逐元素操作)双缓冲(隐藏内存访问延迟)算子融合(省显存带宽)FlashAttention = 分块 + 在线Softmax + 重新排序。在昇腾NPU上, ops-tr
torchtitan-npu = 昇腾NPU上的"一键训练脚本"。它把分布式训练、算子适配、显存优化全部做好,你只需要改配置、改数据,就能训练大模型。支持单机8卡、多机多卡、ZeRO、Gradient Checkpointing、混合精度。NVIDIA 能跑的训练,昇腾NPU 也能跑。

鸿蒙 Electron 是基于OpenHarmony(鸿蒙开源版)操作系统的桌面应用开发框架,本质是 Electron 技术在鸿蒙生态的适配版本。它允许开发者使用 HTML、CSS、JavaScript/TypeScript 编写代码,通过 “渲染进程 + 主进程” 架构,打包生成可在鸿蒙桌面设备(如鸿蒙 PC、智慧屏)运行的原生应用。本文通过基础概念、环境搭建、核心原理和实战案例,完成了鸿蒙 E
使用electron-builder适配鸿蒙系统,修改package.json:"build": {"productName": "鸿蒙日志同步工具","arch": ["x64", "arm64"] // 适配PC与平板架构],"deviceTypes": ["phone", "tablet", "pc"], // 多设备支持打包命令:# 生成鸿蒙安装包(.app格式)
摘要:8卡昇腾910服务器训练LLaMA-2-7B时,加速比仅3倍而非理论8倍,主要瓶颈在于通信开销。昇腾的HCCL集合通信库通过三大设计优化通信:1)集合通信(AllReduce等操作)替代点对点通信;2)分层策略优先低延迟通道;3)拓扑感知自动选择最优算法(如Ring-AllReduce)。实际使用需注意将PyTorch后端设为"hccl",并通过梯度累加、混合精度通信等技

torchtitan-npu = 昇腾NPU上的"一键训练脚本"。它把分布式训练、算子适配、显存优化全部做好,你只需要改配置、改数据,就能训练大模型。支持单机8卡、多机多卡、ZeRO、Gradient Checkpointing、混合精度。NVIDIA 能跑的训练,昇腾NPU 也能跑。

torchtitan-npu = 昇腾NPU上的"一键训练脚本"。它把分布式训练、算子适配、显存优化全部做好,你只需要改配置、改数据,就能训练大模型。支持单机8卡、多机多卡、ZeRO、Gradient Checkpointing、混合精度。NVIDIA 能跑的训练,昇腾NPU 也能跑。

torchtitan-npu = 昇腾NPU上的"一键训练脚本"。它把分布式训练、算子适配、显存优化全部做好,你只需要改配置、改数据,就能训练大模型。支持单机8卡、多机多卡、ZeRO、Gradient Checkpointing、混合精度。NVIDIA 能跑的训练,昇腾NPU 也能跑。

摘要:8卡昇腾910服务器训练LLaMA-2-7B时,加速比仅3倍而非理论8倍,主要瓶颈在于通信开销。昇腾的HCCL集合通信库通过三大设计优化通信:1)集合通信(AllReduce等操作)替代点对点通信;2)分层策略优先低延迟通道;3)拓扑感知自动选择最优算法(如Ring-AllReduce)。实际使用需注意将PyTorch后端设为"hccl",并通过梯度累加、混合精度通信等技
摘要:8卡昇腾910服务器训练LLaMA-2-7B时,加速比仅3倍而非理论8倍,主要瓶颈在于通信开销。昇腾的HCCL集合通信库通过三大设计优化通信:1)集合通信(AllReduce等操作)替代点对点通信;2)分层策略优先低延迟通道;3)拓扑感知自动选择最优算法(如Ring-AllReduce)。实际使用需注意将PyTorch后端设为"hccl",并通过梯度累加、混合精度通信等技







