logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

ns3 Scale Up Ethernet(sue)仿真代码分析

分析sue仿真代码中的 基于信用的流控机制 和 链路层重传的处理。

vllm 分析(十二)——Hisparse下篇

分析 vllm hisparse 的运行原理。

vllm 分析(十一)——deepseek v4 kv cache layout

传入_compute_global_topk_indices_and_lens_kernel的block_size,CSA 和HCA 逻辑 block_size = 256, storage_block_size = block_size/compress_ratio.SWA 缓存:其 block_size 固定为 64,对应 DeepseekV4SWACache 的 storage_block_

vllm 分析(十) ——Hisparse上篇

vllm 实现的Hisparse代码分析。Hisparse主要面向sparse Attention场景,将全量kv cache 存入内存,而HBM中只分配一定大小的hot cache。这样可以降低HBM占用,使得推理程序可以配置更大的batch size。

vllm 分析(九)——pipeline parallelism

分析 vllm pp 并行场景的处理流程

vllm分析(七)——模型结构分析(llama, qwen3moe)

分析vllm 中 llama模型的模块组成

vllm分析(八)——deepseek v4 Attention (SWA + CSA + HCA)

分析vllm deepseek v4SWA,CSA,HCA的计算过程

vllm分析(八)——deepseek v4 Attention (SWA + CSA + HCA)

分析vllm deepseek v4SWA,CSA,HCA的计算过程

    共 28 条
  • 1
  • 2
  • 3
  • 请选择