
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
文生图、图生图类的模型使用越来越广泛,在金融领域中可以用于营销素材、广告生成等场景。当前Qwen-Image-Edit、Stable Diffusion、Wan等系列模型大多数是通过ComfyUI等方式进行本地部署体验,然而,在实际生产环境中,这类模型通常需要以服务化的方式对外提供API接口,而非仅支持本地体验。本文基于昇腾NPU硬件产品,探索Qwen-Image-Edit模型的服务化部署方案,通

本文主要介绍目前小模型领域的服务化情况和Triton Inference Server方案,这也是目前昇腾在小模型服务化的主打方案,并详细介绍三条路径,Python backend、GE custom backend和ONNX-RUNTIME backend子方案。

本文主要介绍目前小模型领域的服务化情况和Triton Inference Server方案,这也是目前昇腾在小模型服务化的主打方案,并详细介绍三条路径,Python backend、GE custom backend和ONNX-RUNTIME backend子方案。

本文详细记录了利用AI Agent辅助打通Qwen3-ForcedAligner和Qwen3-ASR双模型构建实时语音转写与逐词对齐系统的全过程。目标是在一台Atlas 800T A2服务器上实现高并发服务化系统,最大化系统吞吐量。文章分为七个阶段,从单模型打通到双模型联立,再到多卡调度与多进程集群的实现,最终形成了一套完整的生产级服务化系统。项目中,AI Agent在环境配置、性能优化、瓶颈定位
本文详细记录了利用AI Agent辅助打通Qwen3-ForcedAligner和Qwen3-ASR双模型构建实时语音转写与逐词对齐系统的全过程。目标是在一台Atlas 800T A2服务器上实现高并发服务化系统,最大化系统吞吐量。文章分为七个阶段,从单模型打通到双模型联立,再到多卡调度与多进程集群的实现,最终形成了一套完整的生产级服务化系统。项目中,AI Agent在环境配置、性能优化、瓶颈定位
本文详细记录了利用AI Agent辅助打通Qwen3-ForcedAligner和Qwen3-ASR双模型构建实时语音转写与逐词对齐系统的全过程。目标是在一台Atlas 800T A2服务器上实现高并发服务化系统,最大化系统吞吐量。文章分为七个阶段,从单模型打通到双模型联立,再到多卡调度与多进程集群的实现,最终形成了一套完整的生产级服务化系统。项目中,AI Agent在环境配置、性能优化、瓶颈定位
随着小模型在特定任务上展现出接近甚至超越大模型的推理能力,“专而精”的小模型在资源受限场景下优势明显。与此同时,华为Ascend系列算力卡进入市场后,用户对算力资源隔离与整体利用率提升的需求日益迫切。通过资源虚拟化技术,将物理NPU切分为多个vNPU挂载到容器中,可实现统一资源分配与回收,满足多用户频繁申请/释放资源的操作需求。本文以静态虚拟化方式,在昇腾推理服务器裸机上提供小模型RECCE的切分
随着小模型在特定任务上展现出接近甚至超越大模型的推理能力,“专而精”的小模型在资源受限场景下优势明显。与此同时,华为Ascend系列算力卡进入市场后,用户对算力资源隔离与整体利用率提升的需求日益迫切。通过资源虚拟化技术,将物理NPU切分为多个vNPU挂载到容器中,可实现统一资源分配与回收,满足多用户频繁申请/释放资源的操作需求。本文以静态虚拟化方式,在昇腾推理服务器裸机上提供小模型RECCE的切分







