
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
适用场景:Embedding 查表、稀疏 attention、ROI Align 等不规则访问。寄存器之间的数据拷贝,配合 mask 可做 lane 选择。(950PR 都是 8 个 Block 拼成 256B)。按寄存器中的 index 从 UB 取散列数据,用于输出长度非对齐或需要紧凑存储的场景,必须配。
适用场景:Embedding 查表、稀疏 attention、ROI Align 等不规则访问。寄存器之间的数据拷贝,配合 mask 可做 lane 选择。(950PR 都是 8 个 Block 拼成 256B)。按寄存器中的 index 从 UB 取散列数据,用于输出长度非对齐或需要紧凑存储的场景,必须配。
Reg API(寄存器级向量计算 API)是 Ascend C 在 CANN v9.0.0 引入的的编程接口,对应硬件 SIMD Vector Core 内部的(Vector Function Register)文件。所有 Reg API 都位于命名空间,使用修饰。与传统基础 API(DataCopy__aicore__MaskReg。
Reg API(寄存器级向量计算 API)是 Ascend C 在 CANN v9.0.0 引入的的编程接口,对应硬件 SIMD Vector Core 内部的(Vector Function Register)文件。所有 Reg API 都位于命名空间,使用修饰。与传统基础 API(DataCopy__aicore__MaskReg。
Reg API(寄存器级向量计算 API)是 Ascend C 在 CANN v9.0.0 引入的的编程接口,对应硬件 SIMD Vector Core 内部的(Vector Function Register)文件。所有 Reg API 都位于命名空间,使用修饰。与传统基础 API(DataCopy__aicore__MaskReg。
数据搬运高性能实现的核心五原则大分块:单次搬运 ≥ 128KB,充分利用 GM 带宽主维对齐:主搬运维度被 TILE_N 整除,连续字节数 ≥ 512B(A2/A3)/ 128B(950PR)分片复用 L2Cache:重复访问数据先分片(< 128MB),片内连续多次访问多核错开访问:按 blockIdx 轮转 GM 分片顺序,规避同地址冲突搬运/计算重叠:Double Buffer + 轻量 S
数据搬运高性能实现的核心五原则大分块:单次搬运 ≥ 128KB,充分利用 GM 带宽主维对齐:主搬运维度被 TILE_N 整除,连续字节数 ≥ 512B(A2/A3)/ 128B(950PR)分片复用 L2Cache:重复访问数据先分片(< 128MB),片内连续多次访问多核错开访问:按 blockIdx 轮转 GM 分片顺序,规避同地址冲突搬运/计算重叠:Double Buffer + 轻量 S
是 AICore 中 MTE2(Memory Transfer Engine 2)模块提供的硬件 DMA 指令,用于在 OUT(DDR/L2-cache)与 UB(Unified Buffer)之间执行。它将传统 DMA 的"一维搬运"扩展为"5 维循环 + 5 维独立 stride"的通用形式,使得 transpose、broadcast、reshape+broadcast_pad、as_str
是 AICore 中 MTE2(Memory Transfer Engine 2)模块提供的硬件 DMA 指令,用于在 OUT(DDR/L2-cache)与 UB(Unified Buffer)之间执行。它将传统 DMA 的"一维搬运"扩展为"5 维循环 + 5 维独立 stride"的通用形式,使得 transpose、broadcast、reshape+broadcast_pad、as_str
│ basic_api 接口层次 ││ ││ │ • LocalTensor 级别的 API │ ││ │ • 自动流水线管理 │ ││ │ • 自动同步 │ ││ │ → 适合绝大多数算子开发 │ ││ │ ││ ▼ ││ Layer 2: 寄存器计算接口 (reg_api/) ││ │ • 寄存器级别的 API │ ││ │ • 手动流水线管理 │ ││ │ • 手动同步 │ ││ │ → 适







