logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Qwen3-ASR生产级部署文档

Qwen3-ASR是阿里通义千问团队开源的语音识别模型系列,支持52种语言和方言的识别、自动语言检测、字/词级时间戳对齐,以及流式/离线两种推理模式。生产级部署方案采用All-in-One Docker镜像,将Qwen3-ASR(1.7B/0.6B)和强制对齐模型Qwen3-ForcedAligner-0.6B打包在一起,实现“运行时零下载”。对于10-20分钟的音频文件,如遇处理异常,需检查分段

#语音识别
Qwen3-Embedding-8B 模型快速部署与调用指南

在本地部署大语言模型进行文本嵌入和检索,已经成为许多开发者构建私有知识库、提升应用智能化水平的首选方案。相比于依赖云端 API,本地部署不仅数据完全可控,还能在离线环境下稳定运行,特别适合处理敏感文档或需要低延迟响应的场景。然而,从环境配置到最终实现高效的向量检索,中间涉及不少技术细节:如何选择合适的运行库?模型文件该放在哪里?面对海量数据如何批量处理而不爆显存?遇到报错又该如何快速定位?

#python
vLLM-Ascend 快速部署与调用指南

摘要:本文详细介绍了在国产昇腾(Ascend)AI处理器上部署vLLM推理服务的关键步骤和注意事项。首先强调了环境准备的重要性,包括操作系统版本、Python虚拟环境创建及昇腾版PyTorch的安装。随后讲解了Ascend驱动与CANN工具包的配置细节,以及如何正确设置环境变量。源码编译vLLM-Ascend时需指定编译标志,并处理可能出现的依赖问题。模型加载和服务启动阶段需调整显存管理和精度参数

#python#人工智能
vLLM-Ascend 快速部署与调用指南

摘要:本文详细介绍了在国产昇腾(Ascend)AI处理器上部署vLLM推理服务的关键步骤和注意事项。首先强调了环境准备的重要性,包括操作系统版本、Python虚拟环境创建及昇腾版PyTorch的安装。随后讲解了Ascend驱动与CANN工具包的配置细节,以及如何正确设置环境变量。源码编译vLLM-Ascend时需指定编译标志,并处理可能出现的依赖问题。模型加载和服务启动阶段需调整显存管理和精度参数

#python#人工智能
vLLM-Ascend 快速部署与调用指南

摘要:本文详细介绍了在国产昇腾(Ascend)AI处理器上部署vLLM推理服务的关键步骤和注意事项。首先强调了环境准备的重要性,包括操作系统版本、Python虚拟环境创建及昇腾版PyTorch的安装。随后讲解了Ascend驱动与CANN工具包的配置细节,以及如何正确设置环境变量。源码编译vLLM-Ascend时需指定编译标志,并处理可能出现的依赖问题。模型加载和服务启动阶段需调整显存管理和精度参数

#python#人工智能
vLLM-Ascend 快速部署与调用指南

摘要:本文详细介绍了在国产昇腾(Ascend)AI处理器上部署vLLM推理服务的关键步骤和注意事项。首先强调了环境准备的重要性,包括操作系统版本、Python虚拟环境创建及昇腾版PyTorch的安装。随后讲解了Ascend驱动与CANN工具包的配置细节,以及如何正确设置环境变量。源码编译vLLM-Ascend时需指定编译标志,并处理可能出现的依赖问题。模型加载和服务启动阶段需调整显存管理和精度参数

#python#人工智能
vLLM-Ascend 快速部署与调用指南

摘要:本文详细介绍了在国产昇腾(Ascend)AI处理器上部署vLLM推理服务的关键步骤和注意事项。首先强调了环境准备的重要性,包括操作系统版本、Python虚拟环境创建及昇腾版PyTorch的安装。随后讲解了Ascend驱动与CANN工具包的配置细节,以及如何正确设置环境变量。源码编译vLLM-Ascend时需指定编译标志,并处理可能出现的依赖问题。模型加载和服务启动阶段需调整显存管理和精度参数

#python#人工智能
FunASR + SenseVoice Small 在Nvidia上推理优化技术方案

max_single_segment_time=30000, # VAD 最大单段时长(ms),避免切得太碎。merge_vad=True,# 合并 VAD 切片,减少模型调用次数。merge_vad=False,# 因为没做 VAD,此参数无效或设为 False。vad_model=vad_model_dir,# 建议保留 VAD,防止长音频显存爆炸。# vad_model=None,# 关键:

#语音识别#python
基于vLLM-Ascend 在华为昇腾NPU-300I Duo上部署 Qwen3-Embedding-8B

本文档介绍如何在华为昇腾 NPU(Atlas 300I DUO / 310I Duo)上,使用框架部署 Qwen3-Embedding-8B 文本嵌入模型。Qwen3 Embedding 模型系列是 Qwen 家族最新的专有模型,专为文本嵌入和排序任务设计,提供 0.6B、4B 和 8B 多种尺寸。vLLM Ascend 从 0.9.2rc1 版本开始支持该模型。

#华为
基于vLLM-Ascend 在华为昇腾NPU-300I Duo上部署 Qwen3-Embedding-8B

本文档介绍如何在华为昇腾 NPU(Atlas 300I DUO / 310I Duo)上,使用框架部署 Qwen3-Embedding-8B 文本嵌入模型。Qwen3 Embedding 模型系列是 Qwen 家族最新的专有模型,专为文本嵌入和排序任务设计,提供 0.6B、4B 和 8B 多种尺寸。vLLM Ascend 从 0.9.2rc1 版本开始支持该模型。

#华为
    共 14 条
  • 1
  • 2
  • 请选择