logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

[1] vLLM & Page Attention & Continuous Batching

vLLM 是伯克利开源的高性能 LLM 推理服务框架,核心是PagedAttention 分页注意力,借鉴操作系统虚拟内存管理 KV‑Cache,解决显存碎片化;搭配连续批处理 Continuous Batching,大幅提升 GPU 吞吐量与并发;主要用于线上 API、RAG、Agent 部署,不做模型训练。

#人工智能#transformer
到底了