
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
大模型推理引擎vLLM(32):MOE层相关代码流程梳理_权重重排、量化、GEMM计算、EP、vllm serve命令的解析过程
大模型推理引擎vLLM(20):MOE层相关代码流程梳理_权重重排、量化、GEMM计算、EP
大模型推理引擎vLLM(30):由一个GLM5 bug,整理MLP中的SwiGLU、算子融合、量化相关问题
大模型推理引擎vLLM(30):由一个GLM5 bug,整理MLP中的SwiGLU、算子融合、量化相关问题
大模型推理引擎vLLM(22):怎么添加一个CLI参数以及命令行参数的解析、传递链路代码梳理
大模型推理引擎vLLM(22):怎么添加一个CLI参数以及命令行参数的解析、传递链路代码梳理
大模型推理引擎vLLM(25): 从--kv-cache-dtype fp8_e5m2时gsm8k答非所问的bug梳理kv cache相应代码片段
大模型推理引擎vLLM(25): 从--kv-cache-dtype fp8_e5m2时gsm8k答非所问的bug梳理kv cache相应代码片段
大模型推理引擎vLLM(30):由一个GLM5 bug,整理MLP中的SwiGLU、算子融合、量化相关问题
大模型推理引擎vLLM(30):由一个GLM5 bug,整理MLP中的SwiGLU、算子融合、量化相关问题
大模型推理引擎vLLM(27): TP场景moe与EP场景MOE的相同点和不同点、使用modular_kernel.py的差异
大模型推理引擎vLLM(27): TP场景moe与EP场景MOE的相同点和不同点、使用modular_kernel.py的差异
大模型推理引擎vLLM(21): vllm0.21.0中EP基类代码modular_kernel.py详细走读
大模型推理引擎vLLM(21): vllm0.21.0中EP基类代码modular_kernel.py详细走读
大模型推理引擎 vLLM(28):custom_all_reduce 单机/跨节点原理(IPC、Fabric、HSA)
大模型推理引擎 vLLM(28):custom_all_reduce 单机/跨节点原理(IPC、Fabric、HSA)
大模型推理引擎vLLM(29): 重构vllm021中EP高吞吐代码,消除空泡问题:400us减小到25us
大模型推理引擎vLLM(30): 参考sglang代码,重构vllm021中MOE EP高吞吐代码,消除空泡问题:400us减小到25us
大模型权重的B/T参数量、显存估算、MoE与Dense模型加载区别以及EP相关问题整理
大模型权重的B/T参数量、显存估算、MoE与Dense模型加载区别以及EP相关问题整理








