
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
[1] vLLM & Page Attention & Continuous Batching
vLLM 是伯克利开源的高性能 LLM 推理服务框架,核心是PagedAttention 分页注意力,借鉴操作系统虚拟内存管理 KV‑Cache,解决显存碎片化;搭配连续批处理 Continuous Batching,大幅提升 GPU 吞吐量与并发;主要用于线上 API、RAG、Agent 部署,不做模型训练。
到底了







