logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

长输入短输出场景下的 SGLang 推理性能实测前缀缓存、PD 分离配比与参数调优

摘要 本文针对长输入短输出的推理场景(如RAG、长文档问答),通过实测分析了SGLang框架下的优化策略。关键发现: 前缀缓存效果显著:32并发下吞吐提升544%,首token延迟从43.8秒降至6.2秒; 单服务扩展性受限:TP4以上因PCIe瓶颈性能提升不足4%,TP8相较TP4仅提升4%; PD分离需对称配置:非对称配比因KV重分片导致吞吐下降4-14倍,4+4对称配置比单TP8吞吐高22%

文章图片
#缓存
到底了