
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
端到端的语音识别模型CTC(李宏毅深度学习HLP课程笔记)一、CTC1、模型介绍CTC可以用于在线流式语音识别,因此encoder部分需要选择uni-directional RNN,模型结构图如下,输入的语音信号经过encoder逐一转换成语音表征,再经过一个线性分类器得到每个时刻输出类别的概率,假设所有的类别个数为V:一般来说,假设输入的语音长度a,对应的输出label长度为b,则由于语音帧比较
BYOL算法简要介绍。论文地址:byol论文链接。1、self-supervised learning当模型越来越大时,模型训练也会越来越难,会存在梯度消失或者梯度爆炸的问题,需要大量并且是标注的数据来进行训练,因此将目标逐渐转向使用小样本来训练一个泛化性更强的模型。因此而逐渐开始使用self-supervised方法。但是自监督训练存在崩塌问题:我们知道现在大部分的自监督训练都是通过约束同一张图
记录文章《Barlow Twins: Self-Supervised Learning via Redundancy Reduction》阅读笔记,论文地址。1 Abstract & Introduction自监督学习正在迅速发展,它主要是通过学习输入样本的不同distortions版本的不变性embedding特征。其中distortions意思就是同一输入样本经过不同的图像增强变换方式
Speaker Diarization(声纹分割聚类、说话人日志),1、语音检测利用语音检测模型(如VAD),将音频帧逐帧分为语音(speech,即有人说话)和非语音(non-speech,即无人说话)两个类别。其中非语音可能包括静音、噪音、音乐等。2、语音分割/说话人转换检测对于一段语音音频,分割的目标是分割后的每段音频只有一个说话人。有两种方法可以把整段语音切分为多个小段







