
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
ns3 Scale Up Ethernet(sue)仿真代码分析
分析sue仿真代码中的 基于信用的流控机制 和 链路层重传的处理。
vllm 分析(十二)——Hisparse下篇
分析 vllm hisparse 的运行原理。
vllm 分析(十一)——deepseek v4 kv cache layout
传入_compute_global_topk_indices_and_lens_kernel的block_size,CSA 和HCA 逻辑 block_size = 256, storage_block_size = block_size/compress_ratio.SWA 缓存:其 block_size 固定为 64,对应 DeepseekV4SWACache 的 storage_block_
vllm 分析(十) ——Hisparse上篇
vllm 实现的Hisparse代码分析。Hisparse主要面向sparse Attention场景,将全量kv cache 存入内存,而HBM中只分配一定大小的hot cache。这样可以降低HBM占用,使得推理程序可以配置更大的batch size。
mori通信库分析(一)——对称内存RDMA数据发送过程
分析 amd gpu上实现的mori通信库
vllm 分析(九)——pipeline parallelism
分析 vllm pp 并行场景的处理流程
vllm分析(三)——EngineCore 到 Worker 初始化流程分析
分析vllm从engine core 到worker的处理流程
vllm分析(七)——模型结构分析(llama, qwen3moe)
分析vllm 中 llama模型的模块组成
vllm分析(八)——deepseek v4 Attention (SWA + CSA + HCA)
分析vllm deepseek v4SWA,CSA,HCA的计算过程
vllm分析(八)——deepseek v4 Attention (SWA + CSA + HCA)
分析vllm deepseek v4SWA,CSA,HCA的计算过程







