1.一种远场语音识别模型的训练方法,其特征在于,包括:获取近场语音数据集,所述近场语音数据集由若干已标注的近场语音数据组成;
从所述近场语音数据集中抽取预定数量的近场语音数据,并采用重录所述近场语音数据的方式获取远场音频;
将所述远场音频切分为多个远场语音片段,并提取所述远场语音片段中的远场语音特征;
将所述远场语音特征与所述近场语音数据集中的近场语音数据提取的近场语音特征以预设比例进行混叠,所述近场语音数据集中的近场语音数据与获取所述远场语音数据时使用的近场语音数据不同;以及基于混叠后的语音特征数据训练远场语音识别模型。
2.如权利要求1所述的方法,其特征在于,采用重录所述近场语音数据的方式获取远场音频,包括:将所述预定数量的近场语音数据合并成一段能够连续播放的音频数据;
通过播放设备播放所述音频数据,同时通过信号采集设备录制所述音频数据,以生成所述远场音频。
3.如权利要求2所述的方法,其特征在于,所述播放设备与所述信号采集设备之间的距离,根据场景的不同进行相应的设置。
4.如权利要求2所述的方法,其特征在于,所述信号采集设备为多个,多个所述信号采集设备与所述播放设备之间的距离为等差数列。
5.如权利要求2所述的方法,其特征在于,所述播放设备播放所述音频数据时的音量与场景相关。
6.如权利要求2所述的方法,其特征在于,在通过信号采集设备录制所述音频数据,以生成远场音频之后,还包括:对所述远场音频进行校准对齐。
7.如权利要求6所述的方法,其特征在于,对所述远场音频进行校准对齐,包括:获取所述远场音频的起止点,并根据所述起止点对所述远场音频进行截取;
将截取后的所述远场音频与播放的音频数据进行对齐。
8.一种远场语音识别模型的训练装置,其特征在于,包括:获取模块,用于获取近场语音数据集,所述近场语音数据集由若干已标注的近场语音数据组成;
录音模块,用于从所述近场语音数据集中抽取预定数量的近场语音数据,并采用重录所述近场语音数据的方式获取远场音频;
提取模块,用于将所述远场音频切分为多个远场语音片段,并提取所述远场语音片段中的远场语音特征;
处理模块,用于将所述远场语音特征与所述近场语音数据集中的近场语音数据提取的近场语音特征以预设比例进行混叠,所述近场语音数据集中的近场语音数据与获取所述远场语音数据时使用的近场语音数据不同;以及训练模块,用于基于混叠后的语音特征数据训练远场语音识别模型。
9.如权利要求8所述的装置,其特征在于,所述录音模块,用于:将所述预定数量的近场语音数据合并成一段能够连续播放的音频数据;
通过播放设备播放所述音频数据,同时通过信号采集设备录制所述音频数据,以生成所述远场音频。
10.如权利要求9所述的装置,其特征在于,所述播放设备与所述信号采集设备之间的距离,根据场景的不同进行相应的设置。
11.如权利要求9所述的装置,其特征在于,所述信号采集设备为多个,多个所述信号采集设备与所述播放设备之间的距离为等差数列。
12.如权利要求9所述的装置,其特征在于,所述播放设备播放所述音频数据时的音量与场景相关。
13.如权利要求9所述的装置,其特征在于,还包括:校准模块,用于在通过信号采集设备录制所述音频数据,以生成远场音频之后,对所述远场音频进行校准对齐。
14.如权利要求13所述的装置,其特征在于,所述校准模块,用于:获取所述远场音频的起止点,并根据所述起止点对所述远场音频进行截取;
将截取后的所述远场音频与播放的音频数据进行对齐。
15.一种非临时性计算机可读存储介质,其上存储有计算机程序,该计算机程序被处理器执行时实现如权利要求1-7任一项所述的远场语音识别模型的训练方法。
16.一种终端设备,包括处理器、存储器及存储在所述存储器上并可在所述处理器上运行的计算机程序,所述处理器用于执行如权利要求1-7任一项所述的远场语音识别模型的训练方法。