1.一种目标迁移方法,其特征在于,所述方法包括:
获取目标歌声的旋律特征与歌词音素特征,及声源对象音频的个性化时序特征;
基于所述旋律特征,对所述声源对象音频进行第一迁移,得到第一迁移结果;其中,所述第一迁移结果包括所述个性化时序特征及所述旋律特征;
基于所述歌词音素特征,对所述第一迁移结果进行第二迁移,得到第二迁移结果;其中,所述第二迁移结果包括所述个性化时序特征、所述旋律特征及所述歌词音素特征。
2.根据权利要求1所述的方法,其特征在于,所述个性化时序特征至少包括韵律特征,所述基于所述旋律特征,对所述声源对象音频进行第一迁移,得到第一迁移结果,包括:从所述声源对象音频中提取声学特征序列;
根据所述旋律特征对应的时序信息,对所述声学特征序列进行时长调整,得到调整后的声学特征序列;其中,所述调整后的声学特征序列的所述韵律特征对齐所述旋律特征;
基于所述调整后的声学特征序列,确定所述第一迁移结果。
3.根据权利要求2所述的方法,其特征在于,所述根据所述旋律特征对应的时序信息,对所述声学特征序列进行时长调整,得到调整后的声学特征序列,包括:对所述声学特征序列进行插值处理,得到插值后的特征序列;其中,所述插值后的特征序列的长度与所述旋律特征的所述时序信息相匹配;
对所述插值后的特征序列执行平滑操作,得到所述调整后的声学特征序列。
4.根据权利要求3所述的方法,其特征在于,所述对所述插值后的特征序列执行平滑操作,得到所述调整后的声学特征序列,包括:将所述插值后的特征序列输入至目标扩散模型,通过所述目标扩散模型对所述插值后的特征序列进行去噪处理,得到所述调整后的声学特征序列。
5.根据权利要求1所述的方法,其特征在于,所述个性化时序特征至少包括频谱特征,所述基于所述歌词音素特征,对所述第一迁移结果进行第二迁移,得到第二迁移结果,包括:根据所述歌词音素特征的时序信息,确定所述第一迁移结果中与所述时序信息对应的目标结果;
对所述目标结果进行调整,得到所述第二迁移结果;其中,所述目标结果的所述频谱特征对齐所述歌词音素特征。
6.根据权利要求1所述的方法,其特征在于,所述获取目标歌声的旋律特征与歌词音素特征,及声源对象音频的个性化时序特征,包括:对所述目标歌声进行提取,得到所述目标歌声的所述旋律特征;
对所述目标歌声的歌词进行处理,得到所述目标歌声的所述歌词音素特征;
对所述声源对象音频进行提取,得到所述声源对象音频的所述个性化时序特征。
7.根据权利要求6所述的方法,其特征在于,所述对所述目标歌声的歌词进行处理,得到所述目标歌声的所述歌词音素特征,包括:对所述目标歌声的歌词通过至少一个对齐模型进行切分处理,得到所述目标歌声的歌词对应的至少一组歌词时间戳;
获取所述至少一个对齐模型对应的模型权重,并根据所述模型权重,对所述至少一组歌词时间戳进行融合处理,得到融合后的时间信息;
根据所述融合后的时间信息,确定所述歌词音素特征的时序信息。
8.根据权利要求1所述的方法,其特征在于,在所述基于所述歌词音素特征,对所述第一迁移结果进行第二迁移,得到第二迁移结果之后,所述方法还包括:将所述第二迁移结果输入至声码器,通过所述声码器对所述第二迁移结果进行合成处理,得到目标歌声音频;其中,所述目标歌声音频具有所述个性化时序特征、所述旋律特征及所述歌词音素特征。
9.一种目标迁移装置,其特征在于,包括:
获取单元,用于获取目标歌声的旋律特征与歌词音素特征,及声源对象音频的个性化时序特征;
第一迁移单元,用于基于所述旋律特征,对所述声源对象音频进行第一迁移,得到第一迁移结果;其中,所述第一迁移结果包括所述个性化时序特征及所述旋律特征;
第二迁移单元,用于基于所述歌词音素特征,对所述第一迁移结果进行第二迁移,得到第二迁移结果;其中,所述第二迁移结果包括所述个性化时序特征、所述旋律特征及所述歌词音素特征。
10.一种电子设备,其特征在于,包括:
至少一个处理器;以及
与所述至少一个处理器通信连接的存储器;其中,
所述存储器存储有可被所述至少一个处理器执行的指令,所述指令被所述至少一个处理器执行,以使所述至少一个处理器能够执行权利要求1-8中任一项所述的方法。