logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

熙瑾·会悟 ASR 实战:Qwen-ASR 漏字导致转写不完整,如何从音频分段到二次校验解决?

本文结合熙瑾·会悟实际开发场景,分析 Qwen-ASR 在会议转写中出现漏字、文本不完整的常见原因,并从音频预处理、VAD、智能分段、上下文识别、二次 ASR 校验、专业词典及文本纠错等方面,梳理一套可落地的优化方案,为企业级 ASR 系统提升转写完整性和稳定性提供参考。

文章图片
#音视频
熙瑾会悟 ASR 实战:静音场景为什么会出现“幻觉识别”?从 VAD 到解码策略,系统解决语音识别误报问题

本文结合熙瑾会悟实际应用,分析 ASR 在静音、噪声等场景下出现“幻觉识别”的原因,并从 VAD、音频预处理、Segment 切分、模型置信度、异常文本过滤等方面介绍解决方案。同时结合 Whisper、Paraformer、SenseVoice 等模型,梳理企业级 ASR 防幻觉的工程实践,帮助提升会议转写的准确性与稳定性。

文章图片
#语音识别#人工智能
熙瑾会悟 ASR 部署实战:从模型选型到离线推理,企业级语音识别系统到底怎么落地

本文结合熙瑾会悟实际应用场景,系统梳理企业级 ASR 部署过程中常见的问题与解决思路,从 Paraformer、SenseVoice、Whisper 等模型选型,到 VAD、音频切分、ONNX Runtime、TensorRT、GPU 推理,再到流式识别、说话人分离、声纹识别、任务队列及离线部署,深入介绍 ASR 从“模型跑通”到“稳定落地”的工程实践,为企业私有化语音识别和 AI 会议系统部署提

文章图片
#语音识别#人工智能
熙瑾会悟接入 OpenClaw 实战:从插件开发到 Agent 工具集成,踩坑、排错与工程化实践

在熙瑾会悟的研发过程中,我们最近碰到一个比较有意思的问题:如何把已有的语音转写、会议纪要、知识库等能力接入 OpenClaw,让 Agent 不只是“会聊天”,而是真正能够调用业务能力。

文章图片
#ubuntu#linux#运维
熙瑾会悟接入 OpenClaw 实战:从插件开发到 Agent 工具集成,踩坑、排错与工程化实践

在熙瑾会悟的研发过程中,我们最近碰到一个比较有意思的问题:如何把已有的语音转写、会议纪要、知识库等能力接入 OpenClaw,让 Agent 不只是“会聊天”,而是真正能够调用业务能力。

文章图片
#ubuntu#linux#运维
熙瑾会悟接入 OpenClaw 实战:从插件开发到 Agent 工具集成,踩坑、排错与工程化实践

在熙瑾会悟的研发过程中,我们最近碰到一个比较有意思的问题:如何把已有的语音转写、会议纪要、知识库等能力接入 OpenClaw,让 Agent 不只是“会聊天”,而是真正能够调用业务能力。

文章图片
#ubuntu#linux#运维
情感识别实践(四):从模型到工程落地,这一步才是真正的分水岭

针对离线场景下的情感识别需求,我们完成了从数据处理、多模态模型训练到工程化落地的完整闭环。系统采用模块化架构拆分ASR、NLP与音频服务,结合模型量化、异步流水线与GPU优化,解决延迟、并发及资源占用等工程痛点。最终实现93%准确率与280ms响应延迟,验证了系统稳定性。项目核心体会:AI落地不仅是模型调优,更是数据、算法与系统工程的有效协同。

文章图片
#人工智能
基于声纹预处理技术的智能语音识别实现

在 AI 语音识别场景中,语音数据来源复杂,通话环境不可控,往往伴随强背景噪声、回声、通道失真以及大量无效静音片段。如果直接对原始语音进行识别或声纹建模,效果会明显下降。因此,在整个系统中,。熙瑾会悟系统,基于“可落地、可部署”的原则,设计了一套基于声纹预处理的智能语音处理流程,为后续的诈骗识别、说话人建模和行为分析提供高质量输入。

文章图片
#语音识别#人工智能
智能语音识别基于模型优化与部署技术的轻量化方案

智能语音识别通过模型压缩(量化、剪枝)优化存储与运算,提升效率与实时性;增量学习应对新型语音,保证模型更新;利用TensorFlow Lite等工具实现高效部署,适应移动端和边缘设备。

文章图片
#语音识别#人工智能
ASR 实时语音识别中低音量与断句过碎问题的优化实践

本文探讨了实时语音识别(ASR)系统面临的两大核心问题:低音量导致的识别不稳定和断句过碎问题。通过自适应过滤(音频前处理)和多级分句策略(文本后处理)的协同优化,显著提升了系统性能。音频处理采用自适应增益(AGC)和降噪技术改善输入质量,文本处理则通过三级分句(时间窗口、标点恢复、语义规则)和缓冲机制实现自然流畅的输出。特别推荐WebRTC Audio Processing模块进行音频处理,并强调

文章图片
#语音识别#人工智能
    共 37 条
  • 1
  • 2
  • 3
  • 4
  • 请选择