深度学习语音方向入门步骤
·
0 说明
做语音处理有一段时间了,记录总结一下做深度学习语音方向的正确步骤和节点,希望能让后来入门的人少走一些弯路。
初期可能写的内容有点少,等有空了会丰富内容细节,争取做到完整。
step1 语音特征
01 了解具体方向的语音特征
现在基本上不会直接把原始语音序列输入到模型中,而是先特征提取,再将特征输入到模型中去表达。
这里可以根据自己的具体方向有选择的了解,比如语种识别mfcc、gfcc…,说话人识别fbank…,环境噪声分类cqt等…
02 相关特征提取的python库
python有些库直接封装了常见音频特征,如librosa、spafe、torchaudio、sidekit…,可以大概了解库中能提取哪些特征,根据是否满足实验需要来选择使用哪个库。
step2 网络模型构建
01 学习框架
没有经验的话可以先看看框架(比如pytorch、tensorflow)。
02 搜索框架模板
然后去网上搜模型构建的模板,根据模板描述填入内容思路会非常清晰。
03 搜索开源项目
大佬的代码会给我们非常多的启发,特别是细节部分。这个阶段可以找已发表论文的文章代码,拿下来精读代码,最好是做到知道每一行的代码做了什么内容,为什么这么写,然后尝试把项目的代码融合到“02”中的框架模板内,就能融汇成自己的东西了。
step3 调优
模型调优有很多方法,主要是从两个方面入手调优,模型调优(如DroupOut、kernel_size…)和训练调优(如epoch、batch_size、lr…)
更多推荐



所有评论(0)