logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

[AI][昇腾950]内存可见性 / 一致性 / 串行化 在 GPU/NPU 上的语义与差异

内存可见性:一个线程(或核)写入的数据,在何时、在何种条件下能被其他线程(或核)观测到。内存一致性:多个线程对同一内存位置的操作,能否保持一致的全局顺序。串行化:多个并发操作被强制按顺序执行的过程,通常由资源竞争或原子性要求引起。

#人工智能
[AI][昇腾950]内存可见性 / 一致性 / 串行化 在 GPU/NPU 上的语义与差异

内存可见性:一个线程(或核)写入的数据,在何时、在何种条件下能被其他线程(或核)观测到。内存一致性:多个线程对同一内存位置的操作,能否保持一致的全局顺序。串行化:多个并发操作被强制按顺序执行的过程,通常由资源竞争或原子性要求引起。

#人工智能
[AI][昇腾950]AIV直驱 SDMA

传统路径是 Host/AICPU 组 SQE、敲 doorbell,AIV 只能被动等结果。ACLSHMEM 的AIV 直驱 SDMAHost 只做控制面:建 STARS stream / SQ、分配 workspace、创建 Notify。AIV 在 kernel 内直接:读组装 64B SDMA SQE 到 SQdcci刷 cache写 SQ Tail doorbellSTARS/SDMA 引

#人工智能
[AI][昇腾950]AIV直驱 SDMA

传统路径是 Host/AICPU 组 SQE、敲 doorbell,AIV 只能被动等结果。ACLSHMEM 的AIV 直驱 SDMAHost 只做控制面:建 STARS stream / SQ、分配 workspace、创建 Notify。AIV 在 kernel 内直接:读组装 64B SDMA SQE 到 SQdcci刷 cache写 SQ Tail doorbellSTARS/SDMA 引

#人工智能
[AI][昇腾950]多pipeline 编程

基于昇腾社区(CANN / Ascend C 文档)与仓资料整理。适用芯片:Ascend 950PR / Ascend 950DT(= 3510)。

#人工智能#网络
[AI][昇腾950]多pipeline 编程

基于昇腾社区(CANN / Ascend C 文档)与仓资料整理。适用芯片:Ascend 950PR / Ascend 950DT(= 3510)。

#人工智能#网络
[AI][昇腾950] Scalar 性能优化

MainScalar 是 AICore 的串行控制单元,负责取指、译码、参数计算、指令发射、流程控制。当 MainScalar 的指令吞吐跟不上 MTE/Vector/Cube 的执行能力时,计算单元空闲等待,称为。理想(无 Scalar Bound):Scalar: [cfg][cfg]....[cfg].... ← 轻量,提前配置好MTE: [════搬运════][═══搬运═══] ← 持

#人工智能#性能优化
[AI][昇腾950] Scalar 性能优化

MainScalar 是 AICore 的串行控制单元,负责取指、译码、参数计算、指令发射、流程控制。当 MainScalar 的指令吞吐跟不上 MTE/Vector/Cube 的执行能力时,计算单元空闲等待,称为。理想(无 Scalar Bound):Scalar: [cfg][cfg]....[cfg].... ← 轻量,提前配置好MTE: [════搬运════][═══搬运═══] ← 持

#人工智能#性能优化
[AI][昇腾950]同步BufID 方案

在 Ascend950 上,每个 AI Core 内置32 个硬件缓冲锁槽位(buffer-lock slots),每个槽位由一个 5 位编号标识。每个槽位是一个二值信号量,可被核内异步流水线(MTE2/MTE1/M/V/MTE3/FIX/S)通过get_bufrls_buf指令获取与释放。

#人工智能
    共 60 条
  • 1
  • 2
  • 3
  • 6
  • 请选择