
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
网页里做语音功能,很多人的第一反应是调用云端语音识别:采集麦克风、上传音频、等待返回文字,再判断用户说了什么。但如果需求只是“开始录音”“下一页”“打开面板”或者一个固定唤醒词,整套 ASR 链路其实太重了。更合适的做法是关键词识别(KWS):模型不转写整句话,只判断目标短语有没有出现。模型和运行库加载完成后,音频不需要上传到业务服务器。
摘要:ESP32-S3离线语音唤醒方案 本文介绍了一种基于ESP32-S3的离线语音唤醒方案,无需云端、无需固定唤醒词、无需深度学习训练。方案采用onnx-wakeword开源引擎,通过以下步骤实现: 硬件准备:需要带PSRAM的ESP32-S3开发板和麦克风模块 模型原理:将声音转换为Mel频谱图,通过神经网络(Backbone+Head)计算唤醒概率 工程实现: 使用预编译的推理管线 内置5层

听词Voicute平台提供了一种快速生成自定义语音唤醒词模型的解决方案,用户只需输入关键词即可在线训练模型,无需自行处理复杂的语音数据准备和模型训练流程。该平台支持中文、英文等5种语言,提供基础款、语音增强款和多关键词模型三种选择,训练完成后可下载ONNX/TFLite模型在本地设备离线运行。开发者可通过开源推理代码将模型部署到Python、Android、ESP32等多种平台,适用于智能家居、语
摘要:高效多关键词语音识别模型设计与跨平台部署 本文介绍了一种高效的多关键词语音识别方案,通过共享Backbone和独立分类头的设计,将10个语音命令集成到一个仅167KB的模型中。相比传统独立模型方案,该设计减少8倍参数和体积,推理速度提升10倍,同时保持高准确率(负样本准确率96.5%,跨词误触发率<1.2%)。 方案采用Causal DS-TCN架构,利用多标签BCE损失训练,支持一键生成训
摘要:ESP32-S3离线语音唤醒方案 本文介绍了一种基于ESP32-S3的离线语音唤醒方案,无需云端、无需固定唤醒词、无需深度学习训练。方案采用onnx-wakeword开源引擎,通过以下步骤实现: 硬件准备:需要带PSRAM的ESP32-S3开发板和麦克风模块 模型原理:将声音转换为Mel频谱图,通过神经网络(Backbone+Head)计算唤醒概率 工程实现: 使用预编译的推理管线 内置5层

也叫唤醒词识别——设备在待机状态下持续监听,只判断"某个特定词有没有出现"。它的特点是模型极小(几百KB 级),功耗极低,可以常年驻留。它的特点是模型大(50MB 起步),功耗高,不需要常年开。——Apache 2.0 开源,跨 Android/Linux/ESP32/Web 四平台,内置 Mel 频谱提取和五层防误触检测。你有硬件团队,产品量大,芯片选好了就不换。大批量硬件产品(智能开关、86
本文介绍了一套完整的自定义语音唤醒词实现方案,从模型训练到部署落地的全链路实践。针对商业方案成本高、开源项目维护不足的痛点,提供了两种模型获取方式:基于OpenWakeWord的自主训练和在线平台快速生成。重点推荐了跨平台推理引擎onnx-wakeword,支持C++/Android/ESP32/Web等多端部署,内置Mel特征提取和五级防误触发机制。文章包含实测性能数据、唤醒词设计建议和ONNX







