logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

vllm 分析(十) ——Hisparse分析

vllm 实现的Hisparse代码分析。Hisparse主要面向sparse Attention场景,将全量kv cache 存入内存,而HBM中只分配一定大小的hot cache。这样可以降低HBM占用,使得推理程序可以配置更大的batch size。

vllm 分析(九)——pipeline parallelism

分析 vllm pp 并行场景的处理流程

vllm分析(七)——模型结构分析(llama, qwen3moe)

分析vllm 中 llama模型的模块组成

vllm分析(八)——deepseek v4 Attention (SWA + CSA + HCA)

分析vllm deepseek v4SWA,CSA,HCA的计算过程

vllm分析(八)——deepseek v4 Attention (SWA + CSA + HCA)

分析vllm deepseek v4SWA,CSA,HCA的计算过程

vllm分析(六)——KV cache offload

vllmkv cache offload的处理流程

vllm分析(四)——kv cache的初始化

分析vllmkv cache的初始化流程,Tensor的分配和赋值。

#python
vllm分析(五)——pd分离kv cache的处理过程

分析vllm pd分离场景,从远程拉取 kv cache的处理流程

    共 25 条
  • 1
  • 2
  • 3
  • 请选择