登录社区云,与社区用户共同成长
邀请您加入社区
本文针对使用SGLang框架在Atlas 800I A2双机环境下部署DeepSeek-V3.2-W8A8(W8A8量化)模型时,出现服务拉起过程中“Capturing batches”阶段卡死的问题,结合实际排查过程,系统性地梳理了问题根因与解决方案,为类似场景提供可复用的优化路径。模型权重未启用MTP量化,但启动命令中启用了MTP相关参数,导致运行时异常。设置过小,无法满足长序列场景下的集体
传统Copilot依赖开发者主动发起请求,局限于单点任务(如代码片段生成)。新型Agent具备自主决策能力,可分析上下文、拆解任务并主动调用工具链,实现端到端问题解决。开发者从代码编写者转变为目标制定者与质量守门员,更多精力投入架构设计、业务逻辑验证和AI输出校准。需掌握Prompt工程、Agent行为调试等新技能。大模型驱动的Copilot工具已广泛应用于代码补全、文档生成等场景,显著提升开发效
本文记录 Kimi-K3 在单机 8×NVIDIA B300 环境中的部署与压测过程,并对 vLLM、SGLang 两套推理引擎在 64K 与 200K 长上下文场景下的表现进行拆解。
摘要:本文详细记录了在一台双卡GPU机器上部署DeepSeek-V4-Flash-0731模型的全过程,包括环境配置、工具调用修复和性能验证。部署采用SGLang 0.5.16推理框架,支持1M上下文长度,通过OpenAI兼容API提供服务。文章重点解决了工具调用解析、CUDA环境修复等关键问题,并确认当前部署使用的是官方完整Flash精度(部分FP4/FP8量化)。首次启动需约21分钟完成编译和
摘要:本文深度解析三大主流大模型推理引擎架构——vLLM、SGLang和TensorRT-LLM的技术路线差异。vLLM凭借PagedAttention和连续批处理成为生态最丰富的通用方案;SGLang的RadixAttention在Agent场景中通过前缀共享实现50%-70%的Prefill加速;TensorRT-LLM则通过硬件级优化在NVIDIA GPU上提供极致性能。文章对比了三者在KV
多智能体(Multi-Agent)是让多个能够接收信息、做出判断并执行动作的 AI 智能体,围绕一个共同目标进行任务分配、信息交换和协同工作的系统架构。
如果你用过 ChatGPT 或类似的 AI 工具,你的体验大概率是这样的:你问一个问题,AI 给你一个答案。看起来像是一个 AI 从头做到尾。
本文介绍了在UOS V25服务器操作系统上部署天数智芯B150加速卡的SGLang推理服务的完整流程。内容涵盖基础环境配置、驱动安装、容器化部署步骤(包括镜像拉取、容器启动和服务配置)、参数详解以及服务验证方法。关键点包括:使用特定版本Docker镜像,配置必要的卷挂载和权限参数,设置合理的显存预留比例(0.85~0.90),并提供curl测试请求示例。注意事项中强调模型路径需预先准备完整权重文件
Transformers 的 Beam Search 实现集中在的 GenerationMixin 类中,核心方法是。与 vLLM 不同,Transformers 的 Beam Search 是纯张量操作的实现——所有 beam 的扩散、评分、剪枝都通过 PyTorch 张量运算完成,没有面向对象的序列管理,也没有 HTTP 层的编排开销。和 vLLM 老版本的实现一样,支持 early_stop
本文主要介绍一个在sglang启用本地大模型进行对话之后,远程清除对话缓存的一个指令。可以在闲时或者有紧急任务时,释放出一部分的显存出来作其他用途。
特性vLLMSGLangKV Cache 管理页表(Paged KV Cache)前缀树(RadixAttention)前缀复用机制基于哈希的 Prefix Caching基于前缀树的自动匹配调度粒度Block 级别Token 级别结构化生成集成 Outlines/LMFormatEnforcer原生 DSL + FSM 编译预填充/解码分离实验性支持原生支持API 兼容性完全兼容 OpenAI
设计目标对比:吞吐优先 vs 延迟与灵活性平衡内存管理范式差异扩展性与生态集成关键指标对比表格技术选型决策树。
大模型推理框架对比摘要 本报告对比分析了五大主流LLM推理框架(vLLM、SGLang、TensorRT-LLM、LMDeploy、TGI)的核心技术与适用场景。vLLM凭借PagedAttention和Continuous Batching技术,在显存利用率和易用性上表现突出;SGLang专长于结构化生成与复杂推理,RadixAttention技术显著提升多轮对话效率;TensorRT-LLM在
当下版本的KTransformer,相比于旧版本,多出来一个多用户的特性:一个本地模型加载起来之后,支持多路的会话。在释放缓存之前,这个sglang任务所占据的显存空间为:27196MiB,而运行上述指令,清空缓存之后,剩下27064MiB的显存空间。由于显卡资源比较有限,没必要让所有的会话都一直用缓存占据着空间,闲时或者有紧急任务穿插的时候,可以释放一部分显存出来用。话,显存占用还是持久化的保存
经过前七篇,文档 VLM 已经具备"看图答问、SFT 对齐、DPO 抗幻觉"的能力。模型究竟有多好(评测),以及如何让它服务真实流量(部署)。本篇覆盖评测与部署的完整链条。核心认知:VLM 评测远不如 NLP 稳定,部署也比纯 LLM 多几个坑(动态分辨率、视觉 token 显存)。一份零依赖 demo(评测稳定性)附带真实运行结果。✅ 识别 VLM 评测不稳定的三个根因,掌握"评分规则脆弱性"这
场景一:高吞吐量补全(纯文本续写,固定长度)。场景二:低延迟对话(多轮交互,短输出)。场景三:复杂结构化生成(JSON 输出、函数调用、多步推理)。场景四:长上下文处理(128K+ 上下文,检索增强生成)。从架构演进来看,效率与灵活性的平衡将成为下一代推理框架的核心命题。vLLM 正在探索更灵活的状态管理以支持轻量级工作流,而 SGLang 则持续优化其底层执行引擎以提升基础吞吐。
在当前以对话为主的 LLM 推理场景中,Beam Search 较少使用。如果以 Beam Search 为核心来组织推理流程,会显著增加代码复杂度,所以在当前的主流推理引擎中,都没有将 beam search 作为核心链路,SGLang 甚至相当长时间都不支持。在搜索推荐场景里,当大模型用作召回时,需要召回多条可能满足用户诉求的资源,这和 Beam Search 返回多结果的特性正好契合,因此部
直接调用 Transformers 的 generate(),很适合验证模型是否能工作,却不等于具备生产服务能力。在线请求的长度、到达时间和生成长度都不一样,朴素实现很容易出现 KV Cache 浪费、静态批处理等待和相同前缀重复计算。
2026年主流大模型推理框架横评 随着Llama 4、Qwen 3等开源模型性能逼近GPT-4o水平,企业私有化部署需求激增。本文对比三大主流推理框架: vLLM(UC Berkeley) 核心创新:PagedAttention显存管理技术 优势:连续批处理使吞吐量提升1-2个数量级,显存利用率达90%+ 适用场景:工业级高并发生产环境 SGLang(LMSYS分支) 特色功能:RadixAtte
本文将对当前大语言模型(LLM)推理领域两大高性能开源框架——vLLM 与 SGLang 进行全面的性能对比与深度解析。我们将从设计哲学、核心架构、吞吐量、延迟、内存效率、易用性、生态支持等多个维度展开评测,并结合实际应用场景(如 API 服务、批量推理、长上下文处理)给出选型建议,旨在帮助开发者和研究者根据自身需求做出最佳技术决策。
大模型推理引擎vLLM(30): 参考sglang代码,重构vllm021中MOE EP高吞吐代码,消除空泡问题:400us减小到25us
方式本机路径举例带宽延迟CPU参与NVLink~900 GB/s~1μs不参与~25 GB/s~2-5μs不参与GPU0→CPU→内核→CPU→GPU4~10-50μs全程参与。
推理框架的选择不是一劳永逸的决策。随着模型的更新和业务需求的变化,可能需要调整推理方案。重要的是建立一套灵活的推理基础设施,支持多框架共存和动态切换。同时,关注社区的最新进展——推理优化是一个快速演进的领域,今天的"最佳实践"可能在几个月后就被新的方案取代。
vLLM:更像一个“推理操作系统”,管理GPU内存和计算资源。SGLang:更像一个“领域特定语言(DSL)的解释与优化引擎”,关注提示本身的执行效率。vLLM 与 SGLang 并非简单的替代关系,而是互补关系。vLLM 是规模化部署的“基石”,而 SGLang 是提升复杂应用体验的“加速器”。开发者应根据自身业务负载的核心诉求(吞吐 vs 延迟,简单提示 vs 复杂提示)进行技术选型,并在未来
Loop Engeering已经火了一段时间了。如果你刷X,看Youtube,混社区,看自媒体,这是一个绕不过去的新概念。
很多人做本地部署选型时,第一反应是“27B dense 一定比 35B MoE 更小、更轻、更好跑”。但我在单卡 `L20 48GB` 上把 `llama.cpp`、`SGLang`、`vLLM` 三条路线都跑了一遍后,结论恰好相反:`Qwen3.6-35B-A3B` 这颗 MoE 在长上下文服务场景里反而更好部署,`Qwen3.6-27B` dense 不仅没有更轻,某些路线甚至更难落地。
推理引擎是大模型落地的核心基础设施。本文从 vLLM、SGLang、TensorRT-LLM、llama.cpp 四大主流引擎的架构原理、核心优化、性能对比、选型决策四个切口,给出源码级实现与企业级推理服务决策框架。
文章对比了Java后端与大模型应用开发两大技术方向。Java后端市场需求稳定但内卷严重,成长空间有限;大模型应用开发作为新兴技术,薪资高、需求大,是未来5-10年的技术热点。文章详细介绍了大模型学习路径,包括transformer架构、LangChain等技术栈,并指出当前是进入AI领域的好时机,掌握相关技能可获得更高薪资和更多职业可能性。
本文介绍了 Rust 实现的高性能模型服务网关(SMG)的核心架构与关键技术。系统采用分层设计,包括负载均衡策略(7种算法)、gRPC路由管道化处理、4层可靠性机制(断路器/令牌桶/重试/健康检查)、PD分离路由、多模型网关等模块。特别优化了令牌桶的无锁实现、字符串Interning指标存储、全Rust Tokenizer等关键路径,支持Prometheus监控和OpenTelemetry链路追踪
🔥 TensorRT-LLM 2026指南:编译优化与NVFP4量化 摘要: 本文深度解析NVIDIA官方推理引擎TensorRT-LLM v0.18+的架构设计与优化技术。TensorRT-LLM采用预编译引擎模式,通过三阶段流程实现极致性能: 模型转换(HF权重→TRT格式) 引擎构建(图优化/内核融合) 运行时加载(纯CUDA执行) 核心优势包括: 支持FP8/FP4/INT4/NVFP4
本文深入解析了SGLang推理引擎的核心架构与关键技术。SGLang作为新一代大模型推理运行时系统,采用三层架构设计(前端DSL层、运行时层、内核层),相比传统推理引擎具有更精细的缓存管理和结构化生成能力。重点介绍了其核心创新RadixAttention技术,该技术基于基数树实现Token级缓存管理,支持最长公共前缀匹配和部分缓存复用,显著提升了RAG和多轮对话场景的性能。文章还涵盖XGramma
海光DCU BW1100多实例测试显示:单卡144GB HBM显存可在8卡节点上高效运行4个Qwen3.6-35B-A3B模型实例,峰值吞吐达5348.25 tok/s,较单实例提升147%,扩展效率达87%。多实例并发下单路吞吐稳定在8-9.64 tok/s,延迟控制在48-58秒,显存利用率达92%。测试表明BW1100具备接近线性的多任务扩展能力,其超大显存和成熟的ROCm生态为国产AI算力
在深度学习工程落地的过程中,硬件选型往往决定了项目的成本上限与扩展边界。随着 AMD ROCm 生态的日益成熟,越来越多的团队开始尝试将原本基于 NVIDIA CUDA 构建的大模型训练与推理 pipeline 迁移至 AMD GPU 平台。这不仅仅是更换几行代码或修改几个环境变量那么简单,它涉及到从底层算子适配、编译工具链切换,到上层框架兼容性验证的全链路改造。许多开发者在初次接触时,常会被复杂
sglang
——sglang
联系我们(工作时间:8:30-22:00)
400-660-0108 kefu@csdn.net