登录社区云,与社区用户共同成长
邀请您加入社区
AMD宣布为Qwen3.8 27B大模型提供Day 0支持,开发者可在配备AMD Ryzen™ AI Max+处理器或Radeon™ AI PRO R9700显卡(32GB显存)的PC上直接运行该高密度模型。测试显示,该模型在AMD硬件上表现优异,最高生成速度达51.8 Tokens/秒。用户可通过llama.cpp或LM Studio等工具快速部署,AMD的Lemonade平台还简化了AI应用的
本文中 SysOM 为阿里云操作系统控制台运维组件。AI Profiling 作为 SysOM 中智算运维功能之一,主要聚焦 AI 作业的性能分析场景。
为了将 70B 大语言模型的部署成本打下来,我们将线上 vLLM 推理集群的模型权重与激活值从 FP16 全量量化到了 INT8(采用 W8A8 方案)。量化效果立竿见影:单卡 A100-80G 的显存占用直接从 140GB(需 2 卡并行)缩减到了 70GB,单卡即可拉起,推理吞吐量(Tokens/s)提升了将近一倍。然而上线不到两天,客服渠道就接到了多起投诉。在处理复杂代码推导和长文本逻辑分析
前面几个问题讲的都是「混合调度」(Prefill 和 Decode 在同一个 GPU 上混合执行)。V1 的统一 Token 调度 + Chunked Prefill 已经解决了大部分问题:长 prompt 被切成小块,不会一次性占光 budget,Decode 请求不会被完全阻塞。但"不会被完全阻塞"不等于"没有影响"。Step N 的 GPU 批次:│ 请求A: 算 prompt 的第 0~2
本文探讨了一种在企业内网部署DeepSeek-V4大模型的低成本高性能方案。针对FP16全精度推理需要1.3TB显存的难题,提出基于4张RTX 4090(96GB显存)的多卡工作站解决方案,通过张量并行实现INT8精度推理,效果接近FP16。文章详细拆解了硬件配置(联想ThinkStation PX工作站)、分布式推理架构(GPU分工策略)和vLLM张量并行实现,对比了单卡A100与多卡4090的
/ ChatMessage 表示一条对话消息// ChatRequest 对应 POST /v1/chat/completions 的请求体// vLLM 扩展字段// ChatChoice 表示一个候选输出// Usage 表示 Token 计量(第 23 篇会深入讨论)// ChatResponse 对应响应体Created int64 `json:"created"` // Unix 时间戳
前几天在 192.168.31.9 这台 H100 双卡的机器上配 Cline,想用本地的 Qwen3-VL-32B 做代码开发。本以为是个"装个 Ollama 跑模型"的简单活,结果一上手就踩了 6 个坑——Ollama 一直 OOM 加载失败、显存碎片化、split mode 自动跨卡、端口混乱、Model ID 猜不对、容器内外不互通。最后靠换vLLM 的 OpenAI 兼容 API才彻底解
这次做 DCU 推理优化,最容易上瘾的是看一个 kernel 从 0.50 ms 变成 0.33 ms。真正难的却是后面的判断:它一层有多少次调用,是否命中 CUDA Graph,是否改变生成路径,是否只在某个 chunk 上有效,部署到另一个容器后会不会悄悄回退。Profile 找热点,真实形状做微基准,局部候选用 guard 接入,服务结果决定去留,精度最后否决。DCU、ROCm、Triton
本文介绍了如何使用XTuner微调框架对Qwen2.5-1.5B-Instruct模型进行单卡QLoRA微调。主要内容包括:1)XTuner特性分析,突出其配置驱动、多卡支持及完整工具链优势;2)详细环境搭建步骤,包括Conda环境创建和依赖安装;3)模型下载与数据准备方法;4)核心配置文件修改指南,涵盖路径设置、超参数调整等关键环节。教程采用Alpaca格式数据,通过Python配置文件实现全流
推理引擎的分化加剧:vLLM 在单节点吞吐上持续领先,Triton 在集群化部署上深化,TGI 在易用性上发力,llama.cpp 在边缘推理上迭代。没有"全能最优"的引擎,场景匹配是唯一正确的选型方式。投机采样是 2025 年最有价值的新能力:vLLM 的投机采样支持使得长文本推理的 TTFT 有进一步压缩空间。但 Draft Model 的选择和显存消耗是新的约束条件。量化格式的统一仍在演进中
很多人学完 Self-Attention、QKV、FFN 之后,一打开 vLLM / SGLang 源码,立刻懵了。
本文介绍了在Windows WSL2中通过GPU直连部署vLLM大模型推理引擎的完整方案,内容包括: 本地GPU推理的优势 相比云端API更经济、数据更安全 支持自定义模型和私有化部署 可充分利用闲置显卡资源 技术实现原理 WSL2通过DirectX GPU映射实现近乎无损的GPU直连 详细步骤验证GPU可用性 实践指导 vLLM安装配置方法 六大应用场景示例 离线推理与API服务部署 多GPU并
系列文章中篇。上篇解决了环境、基线和 Profile 的可信度问题;这一篇进入算子层,记录专用 Prefill Attention、Q10/Q20 Query 复用、Gate/Up Triton GEMV,以及一批看起来合理但最终没有采用的实验。
注意到对于Qwen 2.5系列模型来说,生成部分并没有tool_call_id相关的内容,笔者查阅相关资料,以及vLLM的tool parser[12](Qwen2.5采用Hermes Parser)[11]后,发现id实际上是获取到大模型输出后,系统随机生成的uuid,这是为了兼容OpenAI的API格式做的工作。在本小节的剩余部分,我们会详细介绍有关请求体和响应体的部分参数,主要是和上下文传递
多机多卡跑大模型,80% 时间不是花在推理上,而是卡在网卡选错、NCCL 握不上手、显存算不清。本文按"报错串→根因→可复现命令"整理成速查 FAQ:Gloo/NCCL 网卡指定、shm 与 P2P、CUDA OOM 显存反向估算、TP/PP 并行怎么切,示例是纯 50GbE 以太网桌面集群(无 IB、免高端交换机)。命令属官方/社区通用做法,硬件数值引白皮书口径,真机吞吐以实测为准。
Prompt 引导 → 后处理验证 → 约束解码 → API 原生结构化输出这个过程中,核心思想从生成后检查转变为生成中约束——从概率保证走向了确定保证。场景推荐方案简单格式要求Prompt 引导 + 后处理验证严格 Schema自部署模型vLLM + XGrammar(推荐)复杂 DSL/文法多平台兼容AI SDK + 适配层不再把模型当作文本生成器,而是把它当作受控的数据生成器。当模型的输出格
本文系统分析了十种主流大语言模型(LLM)服务引擎和工具的技术特点与应用场景,涵盖从浏览器端推理到企业级部署的解决方案。WebLLM利用WebGPU实现浏览器端高性能推理;LM Studio提供本地化离线运行环境;Ollama专注轻量级本地部署;vLLM则通过PagedAttention技术优化GPU内存管理。这些工具在兼容性、计算效率、数据隐私等方面各具优势,同时也存在硬件依赖、模型支持等局限性
验证win10+WSL2本地局域网多机部署vllm可行性
摘要: 量化通过将浮点数转换为整数来优化AI模型性能,核心公式为 ( q = \text{round}((x - \text{min}) / S) ) 和反量化 ( x' = S \times q + \text{min} )。其中,( S )(步长)由数据范围决定,例如FP32转INT8时,( S \approx 0.00784 )。量化虽会损失少量精度(如0.5→0.497),但显著提升计算效
文章摘要 本章系统介绍了自然语言处理(NLP)的核心技术和发展脉络。首先阐述了文本预处理流程,包括清洗、分词、去除停用词等关键步骤,并提供了中英文处理的代码实现。重点讲解了词嵌入技术(Word2Vec、GloVe、FastText)的演进,以及从上下文无关表示到上下文相关表示(如BERT)的转变。同时介绍了语言模型从N-gram到神经网络的进化过程,深入分析了Seq2Seq、注意力机制和预训练-微
源码:https://github.com/DouMaCun/shelf无人货架识别系统。摄像头装在柜门顶部向下俯拍,通过 YOLO 检测手臂进出动作,在商品被取走时自动识别 SKU 并输出 pick 事件。工作原理手臂进入视野↓YOLO 检测 person 类交互状态机(IDLE → ACTIVE → CLASSIFYING → COOLDOWN)↓手臂离开后,从缓冲帧中选最清晰帧YOLO 视觉
第1章 绪论1.1 研究背景随着数字技术与教育教学的深度融合,智慧课堂已成为教育数字化转型的核心载体,依托物联网、人工智能、大数据等技术实现教学过程的实时感知与智能决策。但当前多数系统仍聚焦出勤率、答题正确率等显性指标,对学生课堂情感状态这一隐性维度的感知能力严重不足。情感直接影响学生的注意力集中程度、知识接受意愿与认知加工效率。课堂场景中,学生的面部表情、语音语调、互动文本等多维度信息共同构成真
本文基于YOLOv5算法设计了一个口罩佩戴检测系统,旨在通过深度学习技术提升公共场景下的疫情防控效率。系统采用850张标注数据(包含佩戴口罩、未正确佩戴和未佩戴三类),通过数据增强和80/20划分训练集与验证集。详细阐述了YOLOv5网络结构、训练流程及预测实现,并展示了包括准确率、召回率等性能指标。实验结果表明,该系统能有效识别口罩佩戴状态,具有实际应用价值。最后通过PyQt实现了图形化交互界面
本文深入解析2026年大模型推理弹性伸缩的核心技术,从GPU资源管理、Kubernetes调度到自动扩缩容策略,给出完整的工程实战方案。2026年的AI基础设施工程师必须精通GPU调度、容器编排、成本优化、可观测性等多个领域,才能在企业AI化转型中交付既稳定又经济的推理服务。某头部SaaS公司的AI推理集群在没有弹性伸缩的时期,GPU利用率长期低于30%,每月浪费超过$200,000的硬件成本。那
本文将从硬件核心参数、板载接口拆解、系统部署实操、NPU推理性能、应用场景及硬件优缺点等维度,对Youyeetoo R1 V3.0 RK3588S开发板进行全面、客观的技术梳理,为嵌入式开发、边缘AI部署、多媒体终端开发的开发者提供参考依据。
如何在低端安卓设备上实现实时AI美颜? 当前安卓市场仍有大量骁龙6xx/7xx等低算力设备,面临高端AI影像算法与硬件性能的矛盾。本文提出分层优化方案:1)算法裁剪,包括采用轻量化模型(MobileNet)、INT8量化、传统Haar检测与色彩概率模型结合;2)工程优化,通过异构计算分配(CPU+GPU+DSP)、ROI局部渲染、分辨率动态调整及内存复用技术;3)实测数据显示,该方案在骁龙660等
文章摘要:2026年数字人直播行业进入精细化运营阶段,但多数企业仍以"首月/首年价格"为选型依据,导致实际成本超预算3-5倍。研究基于TCO(总拥有成本)模型对四款主流产品进行3年周期测算,结果显示全源码本地部署方案(如登登AI)的3年总成本仅为云端产品的13%-19%,优势主要体现在消除隐性算力加价、降低违规风险及适配成本上。本地化架构通过技术优化实现硬件轻量化,将RTX30
本文对比了低秩分解与量化在模型压缩中的效果。低秩矩阵通过降维压缩(如SVD分解),适用于嵌入层压缩,压缩比2-10倍但精度损失1-3%。量化则通过降低数据位宽(如INT8/INT4)实现更高压缩比(2-32倍)且几乎无损精度,硬件支持更好,推理加速显著。 核心结论显示,量化在压缩比、加速效果和易用性上全面优于低秩分解,尤其适合大模型部署。低秩分解更适合作为辅助手段,与量化结合(如LoRA+QLoR
涵盖机密计算、零信任、AI 安全、数据安全态势管理(DSPM)、API 安全、供应链安全等。编号类型领域子领域问题【含硬件/软件/电路电子/集成电路/芯片/数据加密/信息加密/热/光/电/力/几何/拓扑/电路/时序/器件物理/半导体/射频/其他】问题的数学分析(含逐步推理)参数列表及边界范围及数值范围关联知识CS-647安全PaaS机密计算:TEE 内数据持久化与 sealed storage硬件
步骤工具输出导出 ONNX.onnx转 TensorRT.engine推理关键点可视化draw_pose骨架图。
YOLOv26N设计核心:1. NPU-Block: 标准Conv替代DWConv, 量化损失最小2. 直接回归: 去掉DFL, 检测头NPU原生支持3. 算子约束: 只用NPU原生支持的算子4. 量化感知训练: 训练时就考虑量化影响5. 硬件协同设计: 架构设计时就考虑NPU特性结果: 量化损失0.4%(vs v8的1.2%), NPU FPS翻倍最好的模型不是精度最高的,而是在目标硬件上表现最