logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Nemotron-3.5-ASR-Streaming-0.6B模型中文微调实战

本文记录NVIDIA Nemotron-3.5-ASR-Streaming-0.6B流式语音识别模型中文微调实战,基于AISHELL-1数据集与单卡RTX 3090,涵盖环境搭建(含numba-cuda踩坑)、数据预处理、配置微调与排错,提供实测可复现的完整流程,帮助读者1~2天跑通微调实验。

#人工智能
【docker使用指南】容器导出-镜像载入-容器创建

本文介绍了Docker容器的导出、镜像载入及容器创建流程。容器导出分为save(基于镜像,保留完整配置)和export(基于容器,仅文件系统快照)两种方式。镜像载入对应使用load和import命令。容器创建通过docker run实现,支持后台运行、端口映射等参数配置。文章详细说明了各步骤的具体操作命令和适用场景,帮助用户快速掌握Docker容器迁移与部署的关键技术。

文章图片
#docker
【vLLM 最新版v0.10.2】docker运行openai服务与GGUF量化使用方式

本文介绍 vLLM v0.10.2 版本通过 Docker 运行 OpenAI 服务及 GGUF 量化的使用方式,明确该量化不支持多模态模型,且仅节约显存、不提升速度。GGUF 量化需要 llama.cpp 环境,接着将 Hugging Face 模型转为 FP16 格式 GGUF,再量化为 Q4_0 等类型(文中列多种支持的量化类型),最后通过 Docker 启动量化后的模型,同样提供了测试请求

文章图片
#docker#容器#语言模型
实时语音转写大模型API对比

本文对比了豆包和讯飞两大实时语音转写大模型API,从准确率、功能、费用等方面进行分析。测试结果显示豆包准确率最高(4.8分),支持中英+5种方言,价格2.4-4元/小时,企业用户享有20小时免费时长;讯飞支持更多方言但准确率较低(1分),价格2-4.95元/小时。功能上讯飞支持角色分离和16个领域,豆包不支持。综合推荐豆包API,其流式异步模式识别效果稳定,更适合企业应用场景。

文章图片
#语音识别
【方言语音识别与翻译实战】:吴语/粤语/川渝方言评测

本文介绍了基于Qwen3-ASR的中文方言语音识别与翻译实践方案。使用WenetSpeech开源数据集(涵盖吴语、粤语、川渝方言),采用Qwen3-ASR-1.7B作为语音识别基础模型,结合Qwen3-8B-AWQ大语言模型构建"ASR识别+文本翻译"级联方案。详细说明了三种方言评测集的数据处理方法,特别是吴语数据集的双任务标注特性,并展示了如何构造联合评测集用于端到端评估。该方案为方言语音技术的

#语音识别
【方言语音识别与翻译实战】:吴语/粤语/川渝方言评测

本文介绍了基于Qwen3-ASR的中文方言语音识别与翻译实践方案。使用WenetSpeech开源数据集(涵盖吴语、粤语、川渝方言),采用Qwen3-ASR-1.7B作为语音识别基础模型,结合Qwen3-8B-AWQ大语言模型构建"ASR识别+文本翻译"级联方案。详细说明了三种方言评测集的数据处理方法,特别是吴语数据集的双任务标注特性,并展示了如何构造联合评测集用于端到端评估。该方案为方言语音技术的

#语音识别
【FireRedASR2S】一款最先进的工业级一体式语音识别系统

FireRedASR2S是一款先进的工业级一体化语音识别系统,整合了语音识别(ASR)、语音活动检测(VAD)、语种识别(LID)和标点预测(Punc)功能。该系统在多项测试中表现优异:ASR模块支持中文(含20+方言)、英语及混语识别,普通话平均错误率2.89%;VAD模块支持100+语言检测,F1分数达97.57%;LID模块准确率97.18%;Punc模块平均F1分数78.90%。提供LLM

文章图片
#语音识别#人工智能
【FireRedASR2S】一款最先进的工业级一体式语音识别系统

FireRedASR2S是一款先进的工业级一体化语音识别系统,整合了语音识别(ASR)、语音活动检测(VAD)、语种识别(LID)和标点预测(Punc)功能。该系统在多项测试中表现优异:ASR模块支持中文(含20+方言)、英语及混语识别,普通话平均错误率2.89%;VAD模块支持100+语言检测,F1分数达97.57%;LID模块准确率97.18%;Punc模块平均F1分数78.90%。提供LLM

文章图片
#语音识别#人工智能
【ASR数据集】中文方言ASR数据集KeSpeech实测:开源模型对决,FireRedASR性能遥遥领先!

KeSpeech数据集覆盖普通话及北京、西南、中原、东北、兰银、江淮、冀鲁、胶辽宫8 种方言。在开源 ASR 模型测试中,中文以字错误率(CER)为指标,FireRedASR 表现最优,总 CER 仅 4.7511,显著优于其他模型;Qwen2-Audio、Paraformer、Dolphin 性能相近,总 WER 在 11-13 区间;Whisper 与 PaddleSpeech 表现较弱,总

文章图片
#语音识别
vLLM使用教程【最新版(V6.0.1.post1)】

vLLM最新版(V0.6.1.post1)beam search方式的使用教程,介绍BeamSearchParams,BeamSearchOutput,BeamSearchSequence,并给出sampling和beam search的示例程序

文章图片
#语言模型
    共 40 条
  • 1
  • 2
  • 3
  • 4
  • 请选择