
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
vllm 分析(十) ——Hisparse分析
vllm 实现的Hisparse代码分析。Hisparse主要面向sparse Attention场景,将全量kv cache 存入内存,而HBM中只分配一定大小的hot cache。这样可以降低HBM占用,使得推理程序可以配置更大的batch size。
mori通信库分析(一)——对称内存RDMA数据发送过程
分析 amd gpu上实现的mori通信库
vllm 分析(九)——pipeline parallelism
分析 vllm pp 并行场景的处理流程
vllm分析(三)——EngineCore 到 Worker 初始化流程分析
分析vllm从engine core 到worker的处理流程
vllm分析(七)——模型结构分析(llama, qwen3moe)
分析vllm 中 llama模型的模块组成
vllm分析(八)——deepseek v4 Attention (SWA + CSA + HCA)
分析vllm deepseek v4SWA,CSA,HCA的计算过程
vllm分析(八)——deepseek v4 Attention (SWA + CSA + HCA)
分析vllm deepseek v4SWA,CSA,HCA的计算过程
vllm分析(六)——KV cache offload
vllmkv cache offload的处理流程
vllm分析(四)——kv cache的初始化
分析vllmkv cache的初始化流程,Tensor的分配和赋值。
vllm分析(五)——pd分离kv cache的处理过程
分析vllm pd分离场景,从远程拉取 kv cache的处理流程







