
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
长输入短输出场景下的 SGLang 推理性能实测前缀缓存、PD 分离配比与参数调优
摘要 本文针对长输入短输出的推理场景(如RAG、长文档问答),通过实测分析了SGLang框架下的优化策略。关键发现: 前缀缓存效果显著:32并发下吞吐提升544%,首token延迟从43.8秒降至6.2秒; 单服务扩展性受限:TP4以上因PCIe瓶颈性能提升不足4%,TP8相较TP4仅提升4%; PD分离需对称配置:非对称配比因KV重分片导致吞吐下降4-14倍,4+4对称配置比单TP8吞吐高22%

到底了







