
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
(OCP Microscaling Format):每 N 个低 bit 元素共享一个 8-bit scale (2^N 形式),Scale = (要素值 × 2^scale) 恢复实际值。:FP32 → FP8 无直接指令时,需双步转换:FP32 → BF16(RNE) → FP8(RNE),但 RNE 两次舍入会产生。:训练时模拟量化误差(forward: 量化+反量化,backward: S
(OCP Microscaling Format):每 N 个低 bit 元素共享一个 8-bit scale (2^N 形式),Scale = (要素值 × 2^scale) 恢复实际值。:FP32 → FP8 无直接指令时,需双步转换:FP32 → BF16(RNE) → FP8(RNE),但 RNE 两次舍入会产生。:训练时模拟量化误差(forward: 量化+反量化,backward: S
(PCIe-through)是 David 芯片在 PCIe 互联场景下,Device 侧(STARS/AIC/RDMA 等)直接通过 PCIe 链路访问 Host 侧内存空间的一种数据通路机制。它区别于 PCIe DMA(使用 IOB TX ATU 进行地址翻译的常规 Outbound 事务),PCIe-through 请求不使用 IOB TX ATU,而是通过 CHI 总线直接将请求送入 PC
(PCIe-through)是 David 芯片在 PCIe 互联场景下,Device 侧(STARS/AIC/RDMA 等)直接通过 PCIe 链路访问 Host 侧内存空间的一种数据通路机制。它区别于 PCIe DMA(使用 IOB TX ATU 进行地址翻译的常规 Outbound 事务),PCIe-through 请求不使用 IOB TX ATU,而是通过 CHI 总线直接将请求送入 PC
TP / CTP / UBmem / UBoE / NC —— 分别承担处理器卡和交换芯片互连功能。(与 9 种模式属两个维度)
TP / CTP / UBmem / UBoE / NC —— 分别承担处理器卡和交换芯片互连功能。(与 9 种模式属两个维度)
UBG(UB Global)和 UBoE(UB over Ethernet)都是URMA(Unified Remote Memory Access)通信模式的子模式,二者使用相同的软硬件编程接口(Jetty 事务层接口),区别在于底层链路不同。工作模式Mode 1(URMA 通信)Mode 4(URMA 通信)报文格式底层链路物理层H112 SerDes (最高 118Gbps/Lane)H112
UBG(UB Global)和 UBoE(UB over Ethernet)都是URMA(Unified Remote Memory Access)通信模式的子模式,二者使用相同的软硬件编程接口(Jetty 事务层接口),区别在于底层链路不同。工作模式Mode 1(URMA 通信)Mode 4(URMA 通信)报文格式底层链路物理层H112 SerDes (最高 118Gbps/Lane)H112
学习要点:负载均衡有三级——TP/TPG 级(vTP 映射)、CTP 端口级(DCNA 查表)、VL Group 级(三层水线)。学习要点:5 种拥塞算法分两类——DCQCN(基于 ECN 反馈)和窗口类(LDCP/CAQM/ACC1.1)。学习要点:这些约束是踩坑高发区。学习要点:利用 CTP 的高包率 + 多路径带宽,由 CCU 接收侧用 counter+flag 自己保序,绕开 TP 的保序
学习要点:负载均衡有三级——TP/TPG 级(vTP 映射)、CTP 端口级(DCNA 查表)、VL Group 级(三层水线)。学习要点:5 种拥塞算法分两类——DCQCN(基于 ECN 反馈)和窗口类(LDCP/CAQM/ACC1.1)。学习要点:这些约束是踩坑高发区。学习要点:利用 CTP 的高包率 + 多路径带宽,由 CCU 接收侧用 counter+flag 自己保序,绕开 TP 的保序







