logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

[AI][昇腾950] 低 Bit 量化

(OCP Microscaling Format):每 N 个低 bit 元素共享一个 8-bit scale (2^N 形式),Scale = (要素值 × 2^scale) 恢复实际值。:FP32 → FP8 无直接指令时,需双步转换:FP32 → BF16(RNE) → FP8(RNE),但 RNE 两次舍入会产生。:训练时模拟量化误差(forward: 量化+反量化,backward: S

#网络#学习
[AI][昇腾950] 低 Bit 量化

(OCP Microscaling Format):每 N 个低 bit 元素共享一个 8-bit scale (2^N 形式),Scale = (要素值 × 2^scale) 恢复实际值。:FP32 → FP8 无直接指令时,需双步转换:FP32 → BF16(RNE) → FP8(RNE),但 RNE 两次舍入会产生。:训练时模拟量化误差(forward: 量化+反量化,backward: S

#网络#学习
[AI][昇腾950] PCIe Through 学习总结

(PCIe-through)是 David 芯片在 PCIe 互联场景下,Device 侧(STARS/AIC/RDMA 等)直接通过 PCIe 链路访问 Host 侧内存空间的一种数据通路机制。它区别于 PCIe DMA(使用 IOB TX ATU 进行地址翻译的常规 Outbound 事务),PCIe-through 请求不使用 IOB TX ATU,而是通过 CHI 总线直接将请求送入 PC

#学习
[AI][昇腾950] PCIe Through 学习总结

(PCIe-through)是 David 芯片在 PCIe 互联场景下,Device 侧(STARS/AIC/RDMA 等)直接通过 PCIe 链路访问 Host 侧内存空间的一种数据通路机制。它区别于 PCIe DMA(使用 IOB TX ATU 进行地址翻译的常规 Outbound 事务),PCIe-through 请求不使用 IOB TX ATU,而是通过 CHI 总线直接将请求送入 PC

#学习
[AI][昇腾950]UB子系统学习

TP / CTP / UBmem / UBoE / NC —— 分别承担处理器卡和交换芯片互连功能。(与 9 种模式属两个维度)

#学习
[AI][昇腾950]UB子系统学习

TP / CTP / UBmem / UBoE / NC —— 分别承担处理器卡和交换芯片互连功能。(与 9 种模式属两个维度)

#学习
[AI][昇腾950]UBG 与 UBoE 学习总结

UBG(UB Global)和 UBoE(UB over Ethernet)都是URMA(Unified Remote Memory Access)通信模式的子模式,二者使用相同的软硬件编程接口(Jetty 事务层接口),区别在于底层链路不同。工作模式Mode 1(URMA 通信)Mode 4(URMA 通信)报文格式底层链路物理层H112 SerDes (最高 118Gbps/Lane)H112

#学习
[AI][昇腾950]UBG 与 UBoE 学习总结

UBG(UB Global)和 UBoE(UB over Ethernet)都是URMA(Unified Remote Memory Access)通信模式的子模式,二者使用相同的软硬件编程接口(Jetty 事务层接口),区别在于底层链路不同。工作模式Mode 1(URMA 通信)Mode 4(URMA 通信)报文格式底层链路物理层H112 SerDes (最高 118Gbps/Lane)H112

#学习
[AI][昇腾950]TP(Transport Layer,传输层)学习笔记

学习要点:负载均衡有三级——TP/TPG 级(vTP 映射)、CTP 端口级(DCNA 查表)、VL Group 级(三层水线)。学习要点:5 种拥塞算法分两类——DCQCN(基于 ECN 反馈)和窗口类(LDCP/CAQM/ACC1.1)。学习要点:这些约束是踩坑高发区。学习要点:利用 CTP 的高包率 + 多路径带宽,由 CCU 接收侧用 counter+flag 自己保序,绕开 TP 的保序

#学习
[AI][昇腾950]TP(Transport Layer,传输层)学习笔记

学习要点:负载均衡有三级——TP/TPG 级(vTP 映射)、CTP 端口级(DCNA 查表)、VL Group 级(三层水线)。学习要点:5 种拥塞算法分两类——DCQCN(基于 ECN 反馈)和窗口类(LDCP/CAQM/ACC1.1)。学习要点:这些约束是踩坑高发区。学习要点:利用 CTP 的高包率 + 多路径带宽,由 CCU 接收侧用 counter+flag 自己保序,绕开 TP 的保序

#学习
    共 76 条
  • 1
  • 2
  • 3
  • 8
  • 请选择