logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

语音识别-LAS模型

前提:将波形图转换成频率相关的频谱图,一般用一个长度为25ms的窗口从头开始,截取25ms的语音信息,称为第一帧,然后向后滑动10ms,再截取第二帧,依次类推,1秒的语音就被截成100帧,接下来对每一帧的波形信号进行变成频谱图,x轴为频率,y轴为强度,用不同颜色表示强度,全部叠加到一起可以得到对应的语谱图,颜色表示这些频率信号的强度。根据人类发声和听觉的特性,还要对原始的频谱进行三角滤波、取对数,

文章图片
#语音识别#人工智能
到底了