
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文深度解析RDMA技术在万卡级AI大模型训练集群中的核心应用。从RoCEv2报文结构、GPUDirect RDMA底层机制到DCQCN拥塞控制算法,剖析RDMA如何突破TCP/IP协议栈瓶颈。结合NCCL集合通信原语与3D并行策略,提供H3C交换机与Mellanox网卡的多厂商实战配置指南及性能Benchmark数据,助力工程师构建高吞吐、低延迟的无损AI算力网络。

本文面向DPU/RDMA/NVMe SSD方向的芯片设计与验证工程师,从硬件实现层面深入剖析AI大模型训练网络的全栈优化路径。覆盖RoCEv2报文处理流水线中BTH/RETH/ATH各字段的硬件分发逻辑、DCQCN拥塞控制中Token Bucket Rate Limiter的RTL级实现、NCCL GIN架构中GPU kernel构造WQE并直接敲击NIC Doorbell寄存器的完整通路、Rai

本文深度解析NCCL集合通信库在AI大模型训练中的RDMA调优实战。从RoCEv2协议底层原理、DCQCN拥塞控制算法,到NCCL内部Ring/Tree拓扑映射,全面剖析通信机制。提供H3C交换机与Mellanox网卡的多厂商配置指南、内核级源码调用链及性能Benchmark对比。结合十余年DPU/RDMA工程经验,分享PFC死锁排查、参数调优等真实踩坑案例,助力构建高性能无损AI训练网络。

SSD寿命预测与健康度监控是企业级存储运维的核心课题。本文从NVMe SMART/Health Information Log(Log Page 02h)协议字段定义出发,深入解析JEDEC JESD218C标准的TBW耐久度评级方法论、NAND闪存P/E循环导致的RBER物理退化模型、Available Spare与Percent Used的计算机制,结合Linux内核nvme驱动源码分析、WD

本文深度剖析Kubernetes环境下RDMA网络的硬件实现与工程实践。从芯片级RTL视角拆解SR-IOV在ConnectX-7中的VF上下文分配与Doorbell机制,结合NVIDIA Network Operator与H3C交换机配置,详解K8s中RDMA设备的池化与直通方案。包含寄存器级时序分析、多厂商实战配置及P999尾延迟评测,为构建微秒级低延迟AI/HPC集群提供芯片级指导。

NVMe SR-IOV是数据中心多租户存储的核心虚拟化技术。本文解析NVMe 2.0 Section 8.26的Primary/Secondary Controller架构、PCIe VF创建与Namespace容量隔离、virt-mgmt I/O Queue资源分配字段,结合Linux内核sriov_numvfs与vfio-pci直通源码,以及Samsung PM1735 fio实测数据,对比v

SSD掉电是数据完整性的头号杀手。本文深度剖析NVMe 2.0电源状态描述符(32字节PDS、PS0-PS31、APST自动转换表),硬件PLP四层架构(PMIC→VDT→钽电容阵列→固件flush),Exascend/三星/创见/建兴等厂商方案对比,Linux内核nvme_configure_apst源码解析,ATP电容健康诊断机制,以及USENIX FAST 15盘掉电对照实验数据。

NVMe协议是PCIe SSD高性能的软件基石。本文从协议栈分层架构出发,深入拆解NVMe寄存器空间、提交/完成队列的工作机制、六大核心I/O命令的数据流、MSI-X中断与轮询两种模式的设计取舍、Namespace管理模型,以及NVMe 2.0的模块化变革,帮你建立对NVMe协议的完整认知框架。

SSD固件是运行在主控芯片上的嵌入式操作系统,负责FTL地址映射、垃圾回收、磨损均衡、ECC纠错、温度管理等所有底层逻辑。它决定了SSD的性能表现、数据安全和使用寿命。本文从固件的架构分层、核心模块、启动流程、升级机制到安全风险,全面拆解这块"隐藏在硬件中的软件"。

本文带你一文读懂RDMA技术!从传统TCP/IP网络的“数据搬运”痛点出发,深度剖析RDMA零拷贝、内核旁路与CPU卸载三大核心优势。文章不仅横向对比了InfiniBand、RoCE与iWARP三大实现方案,还硬核拆解了QP、MR等底层概念,并附带Verbs API实战代码。无论你是HPC老兵还是云原生新人,都能在这里找到通往高性能网络的大门。








