登录社区云,与社区用户共同成长
邀请您加入社区
本文记录一次内部 8 卡 RTX 3090 服务器上的可复跑对比测试。比较对象为同一份 Qwen3.8-27B 主模型权重:一侧使用 vLLM,另一侧使用 SGLang + DFlash2 投机解码。本文仅描述测试环境、方法和结果,不包含服务器地址、账号、密钥或业务数据。
两者都支持 OpenAI-compatible API,但真正选型要基于自己的模型、GPU、上下文长度、并发和请求模式做压测。官方文档列出的 OpenAI-compatible API 包括 Chat Completions、Completions、Responses、Embeddings、音频转写/翻译等,具体能力取决于不同模型。第二,KV Cache 非常吃显存。它的目标不是训练模型,而是把
配 AVX 指令集的服务器,上下文里塞了视频帧的情况下,token 生成速度大概是个位数每秒。CPU 路径的价值不在于速度,而在于"能跑"这个事实本身——无 GPU 部署可以运行同一模型的视频模式,不用降级到更小的视觉模型,也不用把每一帧都发到云端。但恰恰是这条"无显卡路径"的存在,让 Qwen3.8-27B 从一个"需要 48GB 显存才能玩"的庞然大物,变成了可能在普通服务器、虚拟机甚至边缘网
Milvus 是 Zilliz 打造的全球最主流开源分布式向量数据库,经过 6 年迭代、服务 10000 + 企业客户,凭借多架构硬件适配、多模态向量检索、云原生分布式能力,成为大模型 Agent、RAG 知识库、多模态检索场景的核心记忆底座。本文完整拆解 Milvus 架构迭代、全维度性能优化方案、Agent 智能体落地实战案例,覆盖开源 Milvus 与 Zilliz Cloud 全托管云服务
在今年的 ICML 上,AI Infra 已经悄悄形成了三条清晰主线:GPU / Training System、LLM Serving 和 Agent Infra:GPU / Training System研究如何让模型结构、编译器、通信和 GPU 集群真正协同起来;LLM Serving 开始从单纯追求吞吐,转向围绕 KV Cache、长上下文和异构请求做全局资源调度;Agent Infra
摘要 本文详细介绍了如何在本地使用SGLang推理框架部署Qwen3.5-9B大模型。Qwen3.5-9B是阿里巴巴推出的9B参数稠密模型,支持262K超长上下文和原生多模态能力。SGLang作为高性能推理框架,通过RadixAttention等技术可提供比vLLM快3-5倍的推理速度。文章涵盖了从硬件要求、环境准备、模型下载到服务启动的完整流程,并提供了不同硬件配置下的启动参数建议,以及通过Op
本文介绍了如何在星图GPU平台上自动化部署Qwen3-Embedding-0.6B镜像,实现高效文本嵌入服务。通过sglang推理框架优化,该镜像可在A10 GPU上稳定支撑224 QPS,广泛应用于语义检索、文本分类与向量相似度计算等典型场景,显著提升AI应用的响应速度与资源利用率。
本文详细介绍了如何在云端算力平台上使用4张vGPU高效部署Qwen3-32B模型,并通过sglang框架实现稳定服务。重点讲解了资源利用率优化和依赖管理,包括环境准备、模型获取、多卡部署配置技巧以及常见依赖冲突解决方案,帮助开发者快速掌握大型语言模型的云端部署技术。
本文介绍了在统信UOS V2500系统上部署SGLang服务的两种方法:物理机部署和容器化部署。硬件环境采用浪潮服务器和NVIDIA A100显卡,软件使用SGLang 0.5.4和DeepSeek-R1-Distill-Qwen-1.5B模型。物理机部署包括CUDA环境配置、Python虚拟环境搭建和SGLang服务启动;容器化部署则通过Docker实现,提供了详细的docker-compose
研发团队通过 torch_xray 精度对齐工具,对 GLM-4.x 系列语言模型在昆仑芯平台上的推理过程进行逐层、逐算子的数值对齐,一旦发现精度异常,迅速结合代码判断,可以快速定位和解决精度异常的原因,从而确保 XPU 平台的模型输出与 GPU 平台保持一致;通过双推理框架的适配实践、插件化的高效迭代机制,以及覆盖推理流程全链路的系统级优化能力,GLM-4.x 系列语言模型在昆仑芯 XPU 平台
本文针对使用SGLang框架在Atlas 800I A2双机环境下部署DeepSeek-V3.2-W8A8(W8A8量化)模型时,出现服务拉起过程中“Capturing batches”阶段卡死的问题,结合实际排查过程,系统性地梳理了问题根因与解决方案,为类似场景提供可复用的优化路径。模型权重未启用MTP量化,但启动命令中启用了MTP相关参数,导致运行时异常。设置过小,无法满足长序列场景下的集体
本文记录 Kimi-K3 在单机 8×NVIDIA B300 环境中的部署与压测过程,并对 vLLM、SGLang 两套推理引擎在 64K 与 200K 长上下文场景下的表现进行拆解。
摘要:本文详细记录了在一台双卡GPU机器上部署DeepSeek-V4-Flash-0731模型的全过程,包括环境配置、工具调用修复和性能验证。部署采用SGLang 0.5.16推理框架,支持1M上下文长度,通过OpenAI兼容API提供服务。文章重点解决了工具调用解析、CUDA环境修复等关键问题,并确认当前部署使用的是官方完整Flash精度(部分FP4/FP8量化)。首次启动需约21分钟完成编译和
摘要:本文深度解析三大主流大模型推理引擎架构——vLLM、SGLang和TensorRT-LLM的技术路线差异。vLLM凭借PagedAttention和连续批处理成为生态最丰富的通用方案;SGLang的RadixAttention在Agent场景中通过前缀共享实现50%-70%的Prefill加速;TensorRT-LLM则通过硬件级优化在NVIDIA GPU上提供极致性能。文章对比了三者在KV
多智能体(Multi-Agent)是让多个能够接收信息、做出判断并执行动作的 AI 智能体,围绕一个共同目标进行任务分配、信息交换和协同工作的系统架构。
如果你用过 ChatGPT 或类似的 AI 工具,你的体验大概率是这样的:你问一个问题,AI 给你一个答案。看起来像是一个 AI 从头做到尾。
本文介绍了在UOS V25服务器操作系统上部署天数智芯B150加速卡的SGLang推理服务的完整流程。内容涵盖基础环境配置、驱动安装、容器化部署步骤(包括镜像拉取、容器启动和服务配置)、参数详解以及服务验证方法。关键点包括:使用特定版本Docker镜像,配置必要的卷挂载和权限参数,设置合理的显存预留比例(0.85~0.90),并提供curl测试请求示例。注意事项中强调模型路径需预先准备完整权重文件
本文主要介绍一个在sglang启用本地大模型进行对话之后,远程清除对话缓存的一个指令。可以在闲时或者有紧急任务时,释放出一部分的显存出来作其他用途。
特性vLLMSGLangKV Cache 管理页表(Paged KV Cache)前缀树(RadixAttention)前缀复用机制基于哈希的 Prefix Caching基于前缀树的自动匹配调度粒度Block 级别Token 级别结构化生成集成 Outlines/LMFormatEnforcer原生 DSL + FSM 编译预填充/解码分离实验性支持原生支持API 兼容性完全兼容 OpenAI
设计目标对比:吞吐优先 vs 延迟与灵活性平衡内存管理范式差异扩展性与生态集成关键指标对比表格技术选型决策树。
大模型推理框架对比摘要 本报告对比分析了五大主流LLM推理框架(vLLM、SGLang、TensorRT-LLM、LMDeploy、TGI)的核心技术与适用场景。vLLM凭借PagedAttention和Continuous Batching技术,在显存利用率和易用性上表现突出;SGLang专长于结构化生成与复杂推理,RadixAttention技术显著提升多轮对话效率;TensorRT-LLM在
经过前七篇,文档 VLM 已经具备"看图答问、SFT 对齐、DPO 抗幻觉"的能力。模型究竟有多好(评测),以及如何让它服务真实流量(部署)。本篇覆盖评测与部署的完整链条。核心认知:VLM 评测远不如 NLP 稳定,部署也比纯 LLM 多几个坑(动态分辨率、视觉 token 显存)。一份零依赖 demo(评测稳定性)附带真实运行结果。✅ 识别 VLM 评测不稳定的三个根因,掌握"评分规则脆弱性"这
场景一:高吞吐量补全(纯文本续写,固定长度)。场景二:低延迟对话(多轮交互,短输出)。场景三:复杂结构化生成(JSON 输出、函数调用、多步推理)。场景四:长上下文处理(128K+ 上下文,检索增强生成)。从架构演进来看,效率与灵活性的平衡将成为下一代推理框架的核心命题。vLLM 正在探索更灵活的状态管理以支持轻量级工作流,而 SGLang 则持续优化其底层执行引擎以提升基础吞吐。
在当前以对话为主的 LLM 推理场景中,Beam Search 较少使用。如果以 Beam Search 为核心来组织推理流程,会显著增加代码复杂度,所以在当前的主流推理引擎中,都没有将 beam search 作为核心链路,SGLang 甚至相当长时间都不支持。在搜索推荐场景里,当大模型用作召回时,需要召回多条可能满足用户诉求的资源,这和 Beam Search 返回多结果的特性正好契合,因此部
2026年主流大模型推理框架横评 随着Llama 4、Qwen 3等开源模型性能逼近GPT-4o水平,企业私有化部署需求激增。本文对比三大主流推理框架: vLLM(UC Berkeley) 核心创新:PagedAttention显存管理技术 优势:连续批处理使吞吐量提升1-2个数量级,显存利用率达90%+ 适用场景:工业级高并发生产环境 SGLang(LMSYS分支) 特色功能:RadixAtte
本文将对当前大语言模型(LLM)推理领域两大高性能开源框架——vLLM 与 SGLang 进行全面的性能对比与深度解析。我们将从设计哲学、核心架构、吞吐量、延迟、内存效率、易用性、生态支持等多个维度展开评测,并结合实际应用场景(如 API 服务、批量推理、长上下文处理)给出选型建议,旨在帮助开发者和研究者根据自身需求做出最佳技术决策。
大模型推理引擎vLLM(30): 参考sglang代码,重构vllm021中MOE EP高吞吐代码,消除空泡问题:400us减小到25us
方式本机路径举例带宽延迟CPU参与NVLink~900 GB/s~1μs不参与~25 GB/s~2-5μs不参与GPU0→CPU→内核→CPU→GPU4~10-50μs全程参与。
推理框架的选择不是一劳永逸的决策。随着模型的更新和业务需求的变化,可能需要调整推理方案。重要的是建立一套灵活的推理基础设施,支持多框架共存和动态切换。同时,关注社区的最新进展——推理优化是一个快速演进的领域,今天的"最佳实践"可能在几个月后就被新的方案取代。
vLLM:更像一个“推理操作系统”,管理GPU内存和计算资源。SGLang:更像一个“领域特定语言(DSL)的解释与优化引擎”,关注提示本身的执行效率。vLLM 与 SGLang 并非简单的替代关系,而是互补关系。vLLM 是规模化部署的“基石”,而 SGLang 是提升复杂应用体验的“加速器”。开发者应根据自身业务负载的核心诉求(吞吐 vs 延迟,简单提示 vs 复杂提示)进行技术选型,并在未来
很多人做本地部署选型时,第一反应是“27B dense 一定比 35B MoE 更小、更轻、更好跑”。但我在单卡 `L20 48GB` 上把 `llama.cpp`、`SGLang`、`vLLM` 三条路线都跑了一遍后,结论恰好相反:`Qwen3.6-35B-A3B` 这颗 MoE 在长上下文服务场景里反而更好部署,`Qwen3.6-27B` dense 不仅没有更轻,某些路线甚至更难落地。
推理引擎是大模型落地的核心基础设施。本文从 vLLM、SGLang、TensorRT-LLM、llama.cpp 四大主流引擎的架构原理、核心优化、性能对比、选型决策四个切口,给出源码级实现与企业级推理服务决策框架。
文章对比了Java后端与大模型应用开发两大技术方向。Java后端市场需求稳定但内卷严重,成长空间有限;大模型应用开发作为新兴技术,薪资高、需求大,是未来5-10年的技术热点。文章详细介绍了大模型学习路径,包括transformer架构、LangChain等技术栈,并指出当前是进入AI领域的好时机,掌握相关技能可获得更高薪资和更多职业可能性。
本文介绍了 Rust 实现的高性能模型服务网关(SMG)的核心架构与关键技术。系统采用分层设计,包括负载均衡策略(7种算法)、gRPC路由管道化处理、4层可靠性机制(断路器/令牌桶/重试/健康检查)、PD分离路由、多模型网关等模块。特别优化了令牌桶的无锁实现、字符串Interning指标存储、全Rust Tokenizer等关键路径,支持Prometheus监控和OpenTelemetry链路追踪
🔥 TensorRT-LLM 2026指南:编译优化与NVFP4量化 摘要: 本文深度解析NVIDIA官方推理引擎TensorRT-LLM v0.18+的架构设计与优化技术。TensorRT-LLM采用预编译引擎模式,通过三阶段流程实现极致性能: 模型转换(HF权重→TRT格式) 引擎构建(图优化/内核融合) 运行时加载(纯CUDA执行) 核心优势包括: 支持FP8/FP4/INT4/NVFP4
本文深入解析了SGLang推理引擎的核心架构与关键技术。SGLang作为新一代大模型推理运行时系统,采用三层架构设计(前端DSL层、运行时层、内核层),相比传统推理引擎具有更精细的缓存管理和结构化生成能力。重点介绍了其核心创新RadixAttention技术,该技术基于基数树实现Token级缓存管理,支持最长公共前缀匹配和部分缓存复用,显著提升了RAG和多轮对话场景的性能。文章还涵盖XGramma
sglang
——sglang
联系我们(工作时间:8:30-22:00)
400-660-0108 kefu@csdn.net