登录社区云,与社区用户共同成长
邀请您加入社区
摘要:本文深度解析三大主流大模型推理引擎架构——vLLM、SGLang和TensorRT-LLM的技术路线差异。vLLM凭借PagedAttention和连续批处理成为生态最丰富的通用方案;SGLang的RadixAttention在Agent场景中通过前缀共享实现50%-70%的Prefill加速;TensorRT-LLM则通过硬件级优化在NVIDIA GPU上提供极致性能。文章对比了三者在KV
🔥 TensorRT-LLM 2026指南:编译优化与NVFP4量化 摘要: 本文深度解析NVIDIA官方推理引擎TensorRT-LLM v0.18+的架构设计与优化技术。TensorRT-LLM采用预编译引擎模式,通过三阶段流程实现极致性能: 模型转换(HF权重→TRT格式) 引擎构建(图优化/内核融合) 运行时加载(纯CUDA执行) 核心优势包括: 支持FP8/FP4/INT4/NVFP4
本文深入解析了SGLang推理引擎的核心架构与关键技术。SGLang作为新一代大模型推理运行时系统,采用三层架构设计(前端DSL层、运行时层、内核层),相比传统推理引擎具有更精细的缓存管理和结构化生成能力。重点介绍了其核心创新RadixAttention技术,该技术基于基数树实现Token级缓存管理,支持最长公共前缀匹配和部分缓存复用,显著提升了RAG和多轮对话场景的性能。文章还涵盖XGramma
海光DCU BW1100多实例测试显示:单卡144GB HBM显存可在8卡节点上高效运行4个Qwen3.6-35B-A3B模型实例,峰值吞吐达5348.25 tok/s,较单实例提升147%,扩展效率达87%。多实例并发下单路吞吐稳定在8-9.64 tok/s,延迟控制在48-58秒,显存利用率达92%。测试表明BW1100具备接近线性的多任务扩展能力,其超大显存和成熟的ROCm生态为国产AI算力
在深度学习工程落地的过程中,硬件选型往往决定了项目的成本上限与扩展边界。随着 AMD ROCm 生态的日益成熟,越来越多的团队开始尝试将原本基于 NVIDIA CUDA 构建的大模型训练与推理 pipeline 迁移至 AMD GPU 平台。这不仅仅是更换几行代码或修改几个环境变量那么简单,它涉及到从底层算子适配、编译工具链切换,到上层框架兼容性验证的全链路改造。许多开发者在初次接触时,常会被复杂
本文对比了vLLM和SGLang两款高性能LLM推理框架在个人开发者场景下的表现。评测聚焦吞吐量和首Token延迟两大核心指标,分析了两者在技术架构上的差异:vLLM凭借PagedAttention和ContinuousBatching技术在高吞吐量和显存管理方面表现突出,适合批量处理任务;而SGLang的Pythonic API设计使其在首Token延迟和交互体验上更具优势,更适合实时应用场景。
大模型推理的三大瓶颈:内存、吞吐、延迟传统推理框架的局限性新一代推理框架的兴起吞吐量(Tokens/s)延迟(P50/P90/P99)内存使用效率成本效益分析各项指标冠军汇总框架优势领域性能短板分析。
vLLM与SGLang推理框架性能横评摘要 本文对比了两种主流LLM推理框架——vLLM(聚焦高吞吐)和SGLang(侧重低延迟)的核心特性和性能表现。测试在相同硬件(A100 GPU)和模型(LLaMA-2-7B)下进行,评估了吞吐量、延迟、内存效率和扩展性。 关键发现: 吞吐量:vLLM凭借PagedAttention技术,在长文本推理和大规模并发请求中表现更优;SGLang的动态批处理则在高
GPUStack 支持可插拔的推理引擎架构,允许自定义推理后端及其版本,用于引入 GPUStack 未内置的vLLMSGLangMindIE版本,或接入其他自定义推理引擎镜像。为了部署模型,这里以SGLang最新v0.5.12CUDA 版本官方镜像地址国内镜像地址cu130cu129对于其他 GPU,可前往查找 SGLang 官方打包的专用镜像。在推理后端菜单,编辑 SGLang,在版本配置中选择
同时,FlagGems 新增 6 大领域算子库——FlagDNN、FlagBlas、FlagSparse、FlagFFT、FlagTensor、FlagAudio,覆盖科学计算与信号处理场景,共计 102 个领域算子,从"大模型专用"走向全领域覆盖。厂商目录放置后由插件自动发现加载,vLLM-Plugin-FL、SGLang-Plugin-FL、Megatron-LM-FL、Transformer
测试先于选型:不要只看 Benchmark 跑分,一定要拿你们自己真实业务的 Prompt 分布去压测。短文本和长文本的配比,直接决定了最终的吞吐表现。监控指标抓重点:别光盯着 QPS,核心盯住GPU 显存占用率KV Cache 命中率P99 延迟。尤其是 P99,业务方对卡顿极其敏感。部署隔离:长短文本请求务必分开部署到不同的推理集群,千万不要把它们塞进同一个框架实例中,否则调度器会让你痛不欲生
本文系统梳理了当前主流的大模型推理部署框架,包括vLLM、SGLang、TensorRT-LLM、Ollama、XInference等。vLLM基于PyTorch,采用PagedAttention和ContinuousBatching技术,适合高并发企业级应用;SGLang通过RadixAttention优化缓存复用,擅长多轮交互场景;TensorRT-LLM由NVIDIA深度优化,在GPU上性能
没有"最好",只有"最适合"
## 总结2026年四大主流 LLM 推理框架已各有明确的工程定位:vLLM 是生态最完整的全能选手,SGLang 在高并发和结构化生成上独树一帜,LMDeploy 是国产生态的最佳搭档,TensorRT-LLM 是吞吐量的性能天花板但部署成本最高。建议团队以 vLLM 作为默认起点,根据具体业务瓶颈(延迟/吞吐/量化/国产GPU)再针对性切换到专项优化的框架。与此同时,框架能力分化加剧:有的擅长
SGLang 与 vLLM 并非替代关系,而是同源互补的推理框架:vLLM 擅长通用高并发推理,是简单对话场景的高效选择;SGLang 聚焦复杂结构化任务,通过前端 DSL 与 RadixAttention 技术,实现“可编程性+高效性”的统一,是 Agent 等复杂 LLM 应用的最优解。
大模型推理引擎是支撑长思考链、多工具调用等高级能力的核心基础设施。Kimi K2.5代表新一代结构化推理范式,其本质是将问题拆解、工具调度与结果整合深度耦合的推理流程,而非传统token级续写。vLLM凭借PagedAttention显著提升显存利用率与吞吐量,特别适配32K长上下文场景;sglang则原生支持reasoning-parser与tool-call-parser,确保思维链与函数调用
初始化占位:创建一个与并行采样数n等长的chunks列表,作为每个并行序列结果的最终存放位置。异步消费数据流:通过async for循环,不断地从 SGLang 的数据管道中取出数据块(chunk按索引分发和覆盖:根据每个chunk中的index字段,将其存放到chunks列表的正确位置,并用最新的chunk覆盖掉之前收到的同一序列的旧chunk。保留最终状态:当循环结束时,chunks列表中的每
本文介绍了一个完全本地化的RAG系统构建方案,基于LangChain框架和A40 48G显卡资源实现。系统采用的技术栈包括Ubuntu 22.04、Conda环境管理、SGLang推理框架、Chroma向量数据库等。详细阐述了环境配置步骤(包括系统更新、Conda安装、Python环境创建)和核心组件安装(LangChain、SGLang、PyTorch等)。文章提供了文档处理模块和向量存储模块的
sglang Dense LLM PD分离部署
sglang KV cache管理
HiCache 是 SGLang 在 RadixAttention 基础上的分层 KV Cache 方案。它把 KV cache 组织成三层层级位置作用是否本地数据结构L1GPU 显存推理计算直接使用的 KV cache单实例/单 rank 私有L2CPU Host 内存,通常 pinned/registered扩大本地 cache 容量,作为 L1 与 L3 的中转层单实例/单 rank 私有L
vLLM是“通用高效”的代表,平衡性能与易用;SGLang是“编程+执行一体化”的创新者,强调开发者体验与高级功能;TRT-LLM是“硬件深度优化”的工业标杆,牺牲灵活性换取极致性能。选择时应根据硬件环境、模型类型、开发资源与业务需求综合权衡。例如,在 H100 集群上部署 Qwen3-32B 对话服务,TRT-LLM 或 SGLang 更优;而在消费级 GPU 上快速验证 LLaMA3,则 vL
KV Cache与vLLM、SGLang推理框架
本文提出了一种结合vLLM和SGLang的LLM推理服务架构。vLLM通过PagedAttention等技术实现高性能推理,提供高吞吐低延迟;SGLang则提供结构化生成能力,支持约束解码和多轮对话管理。架构采用分层设计:SGLang运行时负责解析结构化请求、约束编译和负载均衡,vLLM引擎执行高效推理。支持单机或集群部署,通过缓存和并行技术优化性能。该架构兼具vLLM的高性能和SGLang的灵活
DFLASH推测解码原理
《昇腾实战派:SGLang应用与优化全指南》摘要:本系列聚焦昇腾AI处理器与SGLang框架的深度整合,涵盖三大方向:(1)部署实践篇,详细解析sglang在NPU上的运行流程、大模型量化部署方案(如llama3.1-70B w8a8),以及Atlas服务器上Qwen3-235B的单机/分离部署实战;(2)框架优化篇,深入剖析SGLang的prefix cache特性,对比分析其技术原理与性能优势
本文介绍了构建现代LLM推理引擎的核心数据结构Req与SamplingParams。Req对象封装了推理请求的完整状态,通过四个长度字段(cached_len/device_len/max_device_len/extend_len)统一管理prefill和decode阶段。关键设计包括:1)将host(CPU)和device(GPU)状态分离;2)用complete_one和append_hos
本篇内容完成了SGLang推理引擎最核心的模型架构搭建工作,我们用120余行核心Python代码,从零复刻了Qwen3-0.6B的完整网络结构,逐一拆解了嵌入层、归一化、QKV投影、QK-Norm、RoPE、GQA、因果注意力、门控MLP九大核心模块,彻底理清了Decoder-only大模型的底层运算逻辑。同时我们完成了国内权重高速下载、模型权重精准加载、真实对话生成的全流程实战,成功跑通模型前向
本文深入浅出地解析了大模型推理中的Prefill和Decode机制,通过代码示例和通俗类比揭示了四大核心问题:1)推理必须拆分为Prefill和Decode两种模式,这是Transformer自回归生成的本质特性;2)Prefill阶段只取最后一个token结果,因其是唯一需要预测的新内容;3)Decode必须拼接全文重算,因模型不会保留历史KV中间值;4)全程重算导致计算量随文本长度平方级增长,
无论你是正在搭建下一代智能体 AI 应用、优化大模型高吞吐推理服务,还是攻坚多模态音视频生成、强化学习训练落地,这场专属线下动手营,就是为你量身打造!本次 WorkShop 由 GOSIM 与 SGLang 核心团队联合出品,跳出泛泛的理论科普,直抵项目底层,深度拆解 SGLang 的核心架构、前沿能力与生产级落地全流程。当大模型推理性能成为落地核心瓶颈,当多模态生成、智能体工作流对底层框架提出更
在本文档中,我们将为希望快速上手SGLang的人提供一个实用资源。SGLang是一个高性能的LLM推理引擎,可以很好地扩展到大量GPU(https://lmsys.org/blog/2025-05-05-large-scale-ep/)。我们将使用新的Qwen3(https://github.com/QwenLM/Qwen3)模型系列,它在SGLang上获得了首日支持。在这篇博文中,我们将使用8B
此外,需要设置环境变量SGLANG_DG_CACHE_DIR(早期版本为SGL_DG_CACHE_DIR)指定缓存目录,并且以后launch_server启动模型也要加上这个从而提升模型启动速度。python3 -m sglang.launch_server这个改成python3 -m sglang.compile_deep_gemm。按照启动模型的方式一样来启动compile_deep_gemm
如果在服务过程中出现内存不足错误,请尝试通过设置较小的值来减少 KV 缓存池的内存使用量–mem-fraction-static。: 设置为true时,提供tokens给引擎并直接获取输出tokens,通常在RLHF中使用。: 使用的聊天模板。: 模型能够处理的token数量,包括输入的tokens。果在长提示的预填充过程中看到内存不足错误,请尝试设置较小的分块预填充大小。: 如果设置了此选项,则
搭建了sglang Version: 0.5.12.post1环境(注意版本,最新版本可能没有上述bug了)测试openai接口。
vLLM与SGLang对比分析 vLLM和SGLang是两种面向不同场景的LLM推理框架。vLLM专注于通用推理的高吞吐量和低延迟,采用PagedAttention和Continuous Batching技术优化显存管理和批处理效率,适合批量API服务。SGLang则针对结构化推理场景,通过Structured Prompt和SGM调度器优化多轮对话、工具调用等复杂流程,提升交互式应用的灵活性。性
`--disable-overlap-schedule`:关闭`overlap-schedule`,以避免多一次decode。- `SGLANG_TORCH_PROFILER_DIR=./sglang_profile`:指定Profiling数据的保存路径。- `SGLANG_PROFILE_WITH_STACK=False`:是否开启调用栈信息的采集,`False`表示不开启。- `--flus
本文介绍了如何利用 SGLang 框架高效部署小米 MiMo-7B-RL 大模型。SGLang 凭借 RadixAttention、Cuda Graph 捕获和 FlashInfer 后端支持,成为新一代推理加速工具。作者详细展示了在 NVIDIA A800-80GB 服务器上的部署流程,包括环境配置、模型下载、服务启动和性能测试。实测显示,SGLang 能快速加载模型(4.4秒加载14.21GB
你的团队花了三周时间把大模型服务部署上线,结果压测一跑,延迟比预期高三倍,GPU显存占用飙到98%却还在排队。你打开两个引擎的GitHub页面,一个说自己吞吐最高,另一个说自己内存效率最优——benchmark数据在不同文章里互相矛盾。