
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
摘要:高效多关键词语音识别模型设计与跨平台部署 本文介绍了一种高效的多关键词语音识别方案,通过共享Backbone和独立分类头的设计,将10个语音命令集成到一个仅167KB的模型中。相比传统独立模型方案,该设计减少8倍参数和体积,推理速度提升10倍,同时保持高准确率(负样本准确率96.5%,跨词误触发率<1.2%)。 方案采用Causal DS-TCN架构,利用多标签BCE损失训练,支持一键生成训
摘要:ESP32-S3离线语音唤醒方案 本文介绍了一种基于ESP32-S3的离线语音唤醒方案,无需云端、无需固定唤醒词、无需深度学习训练。方案采用onnx-wakeword开源引擎,通过以下步骤实现: 硬件准备:需要带PSRAM的ESP32-S3开发板和麦克风模块 模型原理:将声音转换为Mel频谱图,通过神经网络(Backbone+Head)计算唤醒概率 工程实现: 使用预编译的推理管线 内置5层

品牌唤醒词是产品定义的一环。"小爱同学"不只是个名字,它是小米生态的识别符号。用户习惯了叫这个名字,品牌归属感也慢慢建立起来。自定义唤醒词给了用户更高的自由度——智能开关可以叫"打开灯光",老人呼叫器可以叫"呼叫小张",儿童玩具可以叫"小恐龙"。名字跟使用场景绑定,交互更自然,且不少公司逐渐把它作为品牌差异化的一部分。做自定义唤醒词功能时,需要限制字数(一般 3-5 个字)、检测多音字并提醒、定义
也叫唤醒词识别——设备在待机状态下持续监听,只判断"某个特定词有没有出现"。它的特点是模型极小(几百KB 级),功耗极低,可以常年驻留。它的特点是模型大(50MB 起步),功耗高,不需要常年开。——Apache 2.0 开源,跨 Android/Linux/ESP32/Web 四平台,内置 Mel 频谱提取和五层防误触检测。你有硬件团队,产品量大,芯片选好了就不换。大批量硬件产品(智能开关、86
本文介绍了一套完整的自定义语音唤醒词实现方案,从模型训练到部署落地的全链路实践。针对商业方案成本高、开源项目维护不足的痛点,提供了两种模型获取方式:基于OpenWakeWord的自主训练和在线平台快速生成。重点推荐了跨平台推理引擎onnx-wakeword,支持C++/Android/ESP32/Web等多端部署,内置Mel特征提取和五级防误触发机制。文章包含实测性能数据、唤醒词设计建议和ONNX







