登录社区云,与社区用户共同成长
邀请您加入社区
【摘要】本文深入讲解RK3588S三核NPU的多线程推理优化。揭示默认单实例只用一个核心的根本原因,提出两大策略:1)单模型三核并发,通过rknn_set_core_mask设置RKNN_NPU_CORE_0_1_2,单次推理延迟降低约40%;2)多模型多实例并发,三线程各绑一核,三路视频总吞吐提升3倍。给出完整的生产级C++多线程推理框架代码,含任务队列、条件变量同步、回调式异步API用法。附r
本文探讨了在骁龙X2 Elite平台上优化大模型推理的系统级技术,重点介绍了异构协同推理架构。通过高通AI引擎调度器,将计算密集型算子(如矩阵乘法)分配给NPU,控制密集型算子(如Softmax、KV Cache管理)分配给CPU,实现高效协同。文章还概述了流式推理、KV Cache优化、内存管理等关键技术,并提供了Transformer层的异构算子分配代码示例,展示了如何在不同计算引擎间分配任务
Per-token量化python# SGLang启用RadixAttentionimport sglang as sglbackend = sgl.Runtime( model_path="meta-llama/Llama-4-70B", enable_prefix_caching=True, # 关键 chunked_prefill_size=4096,)# 多请求共享前缀prompts =
MSA为注意力机制优化提供了新范式,后续可能出现更多多阶段架构## 结语MiniMax M3的MSA架构不是简单的"省钱方案",而是Agent工业化的基础设施突破。- 使用低维投影快速筛选与当前Query相关的Key集合- 只保留top-k%的Key进入后续精细计算- 复杂度从O(n²)降至O(n × k),k通常为n的5-10%- 对被粗筛排除的Token,使用低秩近似计算补偿注意力- 确保长距
本文系统梳理软件性能优化的方法论:先建立性能思维,用估算和基准测试判断优化价值,再借助 perf、VTune、benchmark 等工具定位瓶颈。文章从 CPU 流水线、执行端口、缓存、内存墙、分支预测、SIMD 向量化、LTO/PGO、指令集构建,到锁粒度、读写锁、原子操作、伪共享与 TLS,串起一套从测量到落地的优化清单。核心观点是别凭感觉调参,而要理解硬件限制、用数据验证收益,在可读性和复杂
本文深入探讨了CH32V305 MCU在USB2.0 CDC串口通信中的极限吞吐性能,实测速度高达30.8MB/s,接近USB2.0 High-Speed模式的理论上限。通过硬件配置、DMA优化和双缓冲技术等调优手段,显著提升传输效率,适用于固件升级、高速数据采集等场景。文章还提供了详细的性能瓶颈分析和实战优化方案。
本文探讨了高效处理大文件数据的策略,重点比较了流式读取与分块处理的优劣。对于CSV文件,推荐根据任务需求选择方法:逐行流式读取适合简单过滤和累计统计(内存占用<10MB),而Pandas的chunksize分块(5万-10万行)更适合复杂聚合任务。文章还介绍了Pandas内存优化技巧,如精确指定数据类型(用int8/category替代默认类型)可降低87%内存占用。对于JSON文件,推荐使用ij
消息队列(Queue)信号量(Semaphore)消息队列主要用于任务与任务、任务与中断之间传递数据信号量主要用于任务同步以及资源管理消息队列的作用几乎是不可替代的。如果需要在任务与任务,或者任务与中断之间传递数据,那么消息队列通常都是首选机制。但在实际应用中,很多时候并不需要传递数据。中断通知任务一个任务唤醒另一个任务某个事件发生后通知任务继续执行这种情况,本质上只是 发送通知和接收通知。二值信
地平线BPU部署核心:1. BPU是CNN专用加速器, 不是通用NPU2. 天工开物工具链是必经之路3. YOLOv8适配关键: C2f拆解 + 检测头简化4. 混合精度: backbone INT8 + head FP165. 能效比是BPU的最大优势(32-39 FPS/W)选型建议: 追求能效选地平线, 追求生态选Jetson地平线BPU在能效比上有着显著优势,特别适合对功耗敏感的边缘场景。
输入:10,950 个 NetCDF 格式的逐日海表温度文件(30 年 × 365 天),每个文件 1,166 × 721 网格点计算:对夏季(6–8 月)92 天,以 11 天滑动窗口(±5 天)统计 30 年间每个像素点的气候态均值(Clim)和 90% 分位数(P90)输出:92 个 NetCDF 文件验证:与参考数据逐日交叉验证 RMSE这是一个典型的数据密集型 + 尴尬并行任务——大量
这篇文章提供了在RK3588边缘计算设备上优化AI模型性能的完整指南。作者通过5个关键步骤将YOLOv8模型的推理速度从2fps提升到30fps:1) 模型量化(FP32→INT8);2) 使用NPU替代CPU进行推理;3) 利用多核NPU并行处理;4) 降低输入分辨率;5) 采用帧跳过策略。文章还分享了多摄像头稳定采集、离线模式实现方案以及设备自愈机制,并给出了优化前后的性能对比数据。这些技巧帮
时间预期演进技术指标提升2024-2025DCU K300(CDNA 3 衍生)2026+新一代架构Chiplet 设计,独立矩阵引擎 IP长期完全自主 ISA减少 CDNA IP 依赖,独立指令集1. 环境准备2. 验证环境3. 查看设备hy-smi4. 运行模型# 单卡# 多卡分布式5. 提交集群6. 性能分析海光 DCU 是中国自主 GPGPU 道路上的重要里程碑。
本文介绍了如何在星图GPU平台上自动化部署SGLang-v0.5.6镜像,实现高效的大语言模型推理。该镜像通过创新的RadixAttention技术,在处理多轮对话和批量文本生成任务时,吞吐量提升高达342%,延迟降低59%,显著提升AI应用的响应速度和资源利用率。
本文分享 TileLang 在 AMD GPU 上的调试经验,利用 rocprof 精准定位内核性能瓶颈。通过动态分块、消除线程束发散及流水线重叠三大方法,有效解决内存墙与计算延迟问题,助力开发者实现大模型算子的高效优化。
本文深入解析 TileLang 编程入门,助开发者解锁 AMD GPU 底层性能潜力。通过手动管理数据分块与共享内存,优化矩阵乘法算子,显著提升 MI300X 等硬件的推理效率,是突破通用库瓶颈、定制高性能内核的关键技术。
本文介绍了如何在星图GPU平台上自动化部署SGLang-v0.5.6镜像,以构建高性能大语言模型推理服务。该镜像通过RadixAttention等核心技术,显著优化了多轮对话、任务规划等复杂AI程序的响应速度与资源利用率,适用于需要快速、结构化文本生成的各类应用场景。
本文介绍了SGLang框架如何通过RadixAttention技术优化大语言模型的多轮对话性能。在星图GPU平台上,用户可以自动化部署SGLang-v0.5.6镜像,快速搭建高性能推理服务。该方案特别适用于智能客服等需要处理连续对话的场景,能显著提升响应速度与并发处理能力。
本文介绍了如何在星图GPU平台上自动化部署SGLang-v0.5.6镜像,以优化大语言模型推理性能。该平台简化了部署流程,用户可快速搭建高性能推理服务。SGLang-v0.5.6的核心应用场景是高效处理多轮对话,通过其RadixAttention技术复用计算缓存,显著提升聊天机器人等交互式应用的吞吐量并降低延迟。
- 硬件级隔离,实例间零干扰- 内存带宽和 SM 按比例分配- 需要重启才能动态调整分区(H100 开始支持部分热调整)### 1.2 vGPU(Virtual GPU)NVIDIA 软件虚拟化方案,支持多个 VM 共享一块物理 GPU,通过时分复用(Time-slicing)实现。:- 无需授权费,开源免费- 多进程真正并行执行(不是时分)- 隔离性弱:一个进程 OOM 可能影响其他进程—##
## 总结2026年四大主流 LLM 推理框架已各有明确的工程定位:vLLM 是生态最完整的全能选手,SGLang 在高并发和结构化生成上独树一帜,LMDeploy 是国产生态的最佳搭档,TensorRT-LLM 是吞吐量的性能天花板但部署成本最高。建议团队以 vLLM 作为默认起点,根据具体业务瓶颈(延迟/吞吐/量化/国产GPU)再针对性切换到专项优化的框架。与此同时,框架能力分化加剧:有的擅长
本文详解如何在 DevCloud 上利用 benchmark_serving.py 对 vLLM 进行科学压力测试。通过分析 RPS、TPS 及 TTFT 等核心指标,定位 AMD Instinct GPU 在 ROCm 环境下的性能拐点,并优化 max-num-seqs 参数,助力开发者精准评估并发容量,实现大模型服务的高效部署。
70B 模型、32K context 的 KV Cache 占用:| 模型 | 32K context KV Cache 显存 ||------|------------------------|| Llama-3-8B (fp16) | 8 GB || Llama-3-70B (fp16) | 64 GB || Qwen-2-72B (fp16) | 70 GB |vLLM、TGI、SGLang
月调用量 < 50M tokens?├── 是 → 用 API / 聚合平台,不要自部署└── 否 → 业务以 Agent / 多轮对话为主?├── 是 → SGLang(70B+ 集群 / 4×H100 起)└── 否 → 单一通用业务流?├── 是 → vLLM v0.23(最稳,生态最好)└── 否(极致性能 / 大规模 SaaS)→ TensorRT-LLM一句话总结三引擎已经不是"性能差
本文详解 PyTorch 算子调试与 ROCm 后端性能剖析指南。通过 rocprof 工具定位 GPU 内核瓶颈,优化 Host-to-Device 数据拷贝及重写慢速算子,解决 AMD Instinct GPU 推理延迟问题,大幅提升模型运行效率。
本文介绍了如何在星图GPU平台上自动化部署vLLM-v0.17.1镜像,实现高效的大语言模型推理服务。该镜像通过PagedAttention和连续批处理技术显著提升性能,适用于智能客服、内容生成等需要高吞吐低延迟的场景,帮助开发者快速构建AI应用。
浪潮信息KOS是浪潮信息基于Linux Kernel、OpenAnolis等开源技术自主研发的一款服务器操作系统,支持x86、ARM等主流架构处理器,性能和稳定性居于行业领先地位,具备成熟的 CentOS 迁移和替换能力,可满足云计算、大数据、分布式存储、人工智能、边缘计算等应用场景需求。vLLM是一种用于大规模语言模型(LLM)推理的框架,旨在提高模型的吞吐量和降低延迟。vLLM通过优化内存管理
本文介绍了如何在星图GPU平台上自动化部署vLLM-v0.17.1镜像,并利用其内置的vLLM Profiler工具进行大型语言模型性能分析。该工具可帮助开发者优化推理延迟、内存使用和吞吐量等关键指标,特别适用于提升在线聊天机器人等实时交互应用的响应效率。
本文介绍了SGLang与vLLM两大推理框架在高吞吐场景下的性能对比。借助星图GPU平台,用户可以自动化部署SGLang-v0.5.6镜像,快速搭建高性能推理服务。该镜像特别擅长处理共享上下文的复杂任务,例如在多轮对话场景中,能通过缓存复用技术显著提升响应速度和吞吐量。
本文聊聊 LLama-Factory,它是一个开源框架,这里头可以找到一系列预制的组件和模板,让你不用从零开始,就能训练出自己的语言模型(微调)。模型路径:/root/LLaMA-Factory/models/glm-4-9b-chat,默认会自动下载模型,不过速度可能比较慢,我们的镜像中已经下载好这个模型,所以直接填写路径更快。已经内置的模型:Yi-1.5-9B-Chat、Qwen2-7B、me
《昇腾实战派:SGLang应用与优化全指南》摘要:本系列聚焦昇腾AI处理器与SGLang框架的深度整合,涵盖三大方向:(1)部署实践篇,详细解析sglang在NPU上的运行流程、大模型量化部署方案(如llama3.1-70B w8a8),以及Atlas服务器上Qwen3-235B的单机/分离部署实战;(2)框架优化篇,深入剖析SGLang的prefix cache特性,对比分析其技术原理与性能优势
本文介绍了如何在星图GPU平台上自动化部署SGLang-v0.5.6镜像,显著提升大语言模型推理吞吐量。该镜像通过RadixAttention技术优化多轮对话处理,适用于客服系统、内容生成等场景,实现2-3倍的性能提升,简化AI服务部署流程。
本文介绍了在星图GPU平台上自动化部署SGLang-v0.5.6镜像,以显著提升大语言模型推理性能。该框架通过RadixAttention等核心技术,在多轮对话等存在大量共享上下文的场景中,能实现高达3倍的吞吐量提升,有效优化AI对话助手等应用的响应效率与资源利用率。
本文详解如何在 AMD 显卡上利用 HIPify、SGLang 与 TileLang 构建高效大模型推理链路。通过自动化代码迁移、连续批处理调度及算子级深度优化,显著降低延迟并提升吞吐量,为摆脱 NVIDIA 依赖提供实战方案。
本文详细记录了在AMD Ryzen 5 5600G核显上使用PyTorch DirectML运行模型的实战经验,包括性能对比、关键配置差异和优化方案。通过对比CUDA平台,揭示了DirectML在AMD核显上的性能瓶颈及优化技巧,为预算有限的开发者提供了实用指南。
显然,赢家是 vLLM。对于单个请求,vLLM 有 11% 的性能提升(Ollama 是 26 个token/秒,而 vLLM 是 29 个token/秒)。
本文通过实测对比vLLM直接推理与Llama-Factory API的性能差异,揭示API部署的隐性开销,并提供绕过API层的优化策略。实验显示,vLLM直接调用比API快5倍,吞吐量达15.96条/秒,显著提升企业数据处理效率。关键优化包括权重融合、Prompt模板复现和批量推理实现,适用于大规模AI模型部署场景。
本文通过实测对比,展示了使用vLLM直接推理LoRA微调后的模型相比LLaMA-Factory的API部署快5倍的性能优势。详细介绍了从权重融合到模板构建的全流程优化方法,包括关键配置参数和性能调优技巧,帮助开发者突破推理效率瓶颈,显著提升处理速度。