欢迎来到知嘟嘟! 联系电话:13336804447 卖家免费入驻,海量在线求购! 卖家免费入驻,海量在线求购!
知嘟嘟
我要发布
联系电话:13336804447
知嘟嘟经纪人
收藏
专利号: 2018106018134
申请人: 北京市商汤科技开发有限公司
专利类型:发明专利
专利状态:已下证
专利领域: 乐器;声学
更新日期:2026-07-22
缴费截止日期: 暂无
价格&联系人
年费信息
委托购买

摘要:

权利要求书:

1.一种说话视频的处理方法,其特征在于,所述方法包括:

获取包含图像的第一文件和包含音频的第二文件;

将所述第一文件和所述第二文件输入经过训练得到的说话视频合成模型,得到合成的说话视频,其中,所述说话视频合成模型包括对训练样本解离语音信息得到的解离后的身份子空间和对所述训练样本解离人物身份信息得到的解离后的话语子空间;

输出所述合成的说话视频;

其中,所述将所述第一文件和所述第二文件输入经过训练得到的说话视频合成模型,得到合成的说话视频,包括:对所述第一文件和所述第二文件进行解离,得到解离后的话语子空间和解离后的身份子空间,从解离后的话语子空间中和解离后的身份子空间中各取一个特征向量并连接,采用解码器解码成所述说话视频的一帧。

2.根据权利要求1所述的方法,其特征在于,其中,所述第一文件至少包括以下一种:图像、视频;所述第二文件至少包括以下一种:音频、有声视频。

3.根据权利要求1所述的方法,其特征在于,所述说话视频合成模型的训练过程,包括:获取图像与音频匹配的训练样本;

确定所述训练样本的身份子空间和所述训练样本的话语子空间;

确定所述训练样本中每一帧的话语特征、人脸身份特征和音频特征;

利用所述音频特征和所述话语特征对所述训练样本的身份子空间解离语音信息,得到所述解离后的身份子空间;

利用人脸身份特征对所述训练样本的话语子空间解离人物身份信息,得到所述解离后的话语子空间。

4.根据权利要求3所述的方法,其特征在于,所述确定所述训练样本中每一帧的话语特征、人脸身份特征和音频特征,包括:针对所述训练样本的每一帧;

将帧图像编码到所述训练样本的身份子空间,得到人脸身份特征向量;

将所述帧图像编码到所述训练样本的话语子空间,得到话语特征向量;

将所述帧图像对应的语音信息,编码到所述训练样本的话语子空间,得到音频特征向量。

5.根据权利要求4所述的方法,其特征在于,所述利用所述音频特征和所述话语特征对所述训练样本的身份子空间解离语音信息,得到所述解离后的身份子空间,包括:通过鉴别器利用所述音频特征向量与所述话语特征向量从所述训练样本的身份子空间中去除语音信息,得到所述解离后的身份子空间;

所述利用人脸身份特征对所述训练样本的话语子空间解离人物身份信息,得到所述解离后的话语子空间,包括:通过鉴别器利用所述人脸身份特征向量从所述训练样本的话语子空间中去除人物身份信息,得到所述解离后的话语子空间。

6.根据权利要求4所述的方法,其特征在于,在所述确定所述训练样本中每一帧的话语特征、人脸身份特征和音频特征之后,所述方法还包括:将所述训练样本的话语子空间中的所述音频特征向量与所述话语特征向量映射到预设位置。

7.根据权利要求6所述的方法,其特征在于,所述将所述训练样本的话语子空间中的所述音频特征向量与所述话语特征向量映射到预设位置,包括:利用同一个第一分类器将所述音频特征向量和所述话语特征向量映射到预设空间;

将处于所述预设空间中的所述音频特征向量和处于所述预设空间中的所述话语特征向量映射到所述预设空间中的预设位置。

8.根据权利要求3所述的方法,其特征在于,所述确定所述训练样本的身份子空间和所述训练样本的话语子空间,包括:根据所述训练样本中包含的人物身份信息,确定所述训练样本的人物身份标签;

根据所述训练样本中包含的语音信息,确定所述训练样本的唇语识别标签;

根据获取的所述训练样本的人物身份标签训练所述训练样本的身份子空间;其中,所述人物身份标签用于识别所述人物身份信息中人物的身份;

根据获取的所述训练样本的唇语识别标签训练所述训练样本的话语子空间;其中,所述唇语识别标签用于识别所述语音信息对应的唇部运动。

9.根据权利要求5所述的方法,其特征在于,所述通过鉴别器利用所述音频特征向量与所述话语特征向量从所述训练样本的身份子空间中去除语音信息,得到所述解离后的身份子空间,包括:通过所述鉴别器利用所述音频特征向量与所述话语特征向量从所述训练样本的身份子空间中去除语音信息,得到第一身份子空间;

通过第二分类器将所述第一身份子空间中包含的剩余信息映射到所述训练样本的话语子空间,得到映射结果;

如果所述映射结果表明所述剩余信息中不包含语音信息,将所述第一身份子空间确定为所述解离后的身份子空间;

如果所述映射结果表明所述剩余信息中包含语音信息,通过所述鉴别器从所述第一身份子空间中去除所述剩余信息中包含的语音信息,直到得到不包含语音信息的第二身份子空间;将所述第二身份子空间确定为所述解离后的身份子空间。

10.根据权利要求5所述的方法,其特征在于,所述通过鉴别器利用所述人脸身份特征向量从所述训练样本的话语子空间中去除人物身份信息,得到所述解离后的话语子空间,包括:通过所述通过鉴别器利用所述人脸身份特征向量从所述训练样本的身份子空间中去除人物身份信息,得到第三话语子空间;

通过第二分类器将所述第三话语子空间中包含的剩余信息映射到所述训练样本的身份子空间,得到映射结果;

如果所述映射结果表明所述剩余信息中不包含人脸身份信息,将所述第三话语子空间确定为所述解离后的话语子空间;

如果所述映射结果表明所述剩余信息中包含人脸身份信息,通过所述鉴别器从所述第三话语子空间中去除所述剩余信息中包含的人脸身份信息,直到得到不包含人脸身份信息的第四话语子空间;将所述第四话语子空间确定为所述解离后的话语子空间。

11.根据权利要求7所述的方法,其特征在于,在所述将所述训练样本的话语子空间中的所述音频特征向量与所述话语特征向量映射到预设位置之后,所述方法还包括:通过第三分类器对所述音频特征向量对应的训练样本和所述话语特征向量对应的训练样本进行分类,得到分类结果;

根据所述分类结果,对第三分类器进行对抗训练;

当所述分类结果不为空时,继续对所述第三分类器进行对抗训练,直到所述分类结果为空,结束对所述第三分类器的对抗训练。

12.根据权利要求3所述的方法,其特征在于,所述将所述第一文件和所述第二文件输入经过训练得到的说话视频合成模型,得到合成的说话视频,包括:将所述第一文件输入解离后的身份子空间,获取所述第一文件对应的人脸身份特征向量;

将所述第二文件输入解离后的话语子空间,获取所述第二文件对应的音频特征向量;

根据所述人脸身份特征向量和所述音频特征向量合成预设视频,对所述预设视频进行对抗训练,得到合成的说话视频。

13.一种说话视频的处理装置,其特征在于,所述装置包括:第一获取模块、第一处理模块和第一输出模块,其中:所述第一获取模块,用于获取包含图像的第一文件和包含音频的第二文件;

所述第一处理模块,用于将所述第一文件和所述第二文件输入经过训练得到的说话视频合成模型,得到合成的说话视频,其中,所述说话视频合成模型包括对训练样本解离语音信息得到的解离后的身份子空间和对所述训练样本解离人物身份信息得到的解离后的话语子空间;其中,所述将所述第一文件和所述第二文件输入经过训练得到的说话视频合成模型,得到合成的说话视频,包括:对所述第一文件和所述第二文件进行解离,得到解离后的话语子空间和解离后的身份子空间,从解离后的话语子空间中和解离后的身份子空间中各取一个特征向量并连接,采用解码器解码成所述说话视频的一帧所述第一输出模块,用于输出所述合成的说话视频。

14.根据权利要求13所述的装置,其特征在于,所述第一文件至少包括以下一种:图像、视频;所述第二文件至少包括以下一种:音频、有声视频。

15.根据权利要求13所述的装置,其特征在于,所述装置还包括第一训练模块,用于训练所述说话视频合成模型,所述第一训练模块包括:第一获取单元,用于获取图像与音频匹配的训练样本;

第一确定单元,用于确定所述训练样本的身份子空间和所述训练样本的话语子空间;

第二确定单元,用于确定所述训练样本中每一帧的话语特征、人脸身份特征和音频特征;

第一解离单元,用于利用所述音频特征和所述话语特征对所述训练样本的身份子空间解离语音信息,得到所述解离后的身份子空间;

第二解离单元,用于利用人脸身份特征对所述训练样本的话语子空间解离人物身份信息,得到所述解离后的话语子空间。

16.根据权利要求15所述的装置,其特征在于,所述第二确定单元包括:第一编码子单元,用于针对所述训练样本的每一帧;将帧图像编码到所述训练样本的身份子空间,得到人脸身份特征向量;

第二编码子单元,用于将所述帧图像编码到所述训练样本的话语子空间,得到话语特征向量;

第三编码子单元,用于将所述帧图像对应的语音信息,编码到所述训练样本的话语子空间,得到音频特征向量。

17.根据权利要求16所述的装置,其特征在于,所述第一解离单元,用于通过鉴别器利用所述音频特征向量与所述话语特征向量从所述训练样本的身份子空间中去除语音信息,得到所述解离后的身份子空间;

所述第二解离单元,用于通过鉴别器利用所述人脸身份特征向量从所述训练样本的话语子空间中去除人物身份信息,得到所述解离后的话语子空间。

18.根据权利要求16所述的装置,其特征在于,所述第一训练模块,还包括:映射单元,用于将所述训练样本的话语子空间中的所述音频特征向量与所述话语特征向量映射到预设位置。

19.根据权利要求18所述的装置,其特征在于,所述映射单元,包括:第三映射子单元,用于利用同一个第一分类器将所述音频特征向量和所述话语特征向量映射到预设空间;

第四映射子单元,用于将处于所述预设空间中的所述音频特征向量和处于所述预设空间中的所述话语特征向量映射到所述预设空间中的预设位置。

20.根据权利要求15所述的装置,其特征在于,所述第一训练模块,还包括:第三确定单元,用于根据所述训练样本中包含的人物身份信息,确定所述训练样本的人物身份标签;

第四确定单元,用于根据所述训练样本中包含的语音信息,确定所述训练样本的唇语识别标签;

第一训练单元,用于根据获取的所述训练样本的人物身份标签训练所述训练样本的身份子空间;其中,所述人物身份标签用于识别所述人物身份信息中人物的身份;

第二训练单元,用于根据获取的所述训练样本的唇语识别标签训练所述训练样本的话语子空间;其中,所述唇语识别标签用于识别所述语音信息对应的唇部运动。

21.根据权利要求17所述的装置,其特征在于,所述第一解离单元,包括:第一去除子单元,用于通过所述鉴别器利用所述音频特征向量与所述话语特征向量从所述训练样本的身份子空间中去除语音信息,得到第一身份子空间;

第一映射子单元,用于通过第二分类器将所述第一身份子空间中包含的剩余信息映射到所述训练样本的话语子空间,得到映射结果;

第一确定子单元,用于如果所述映射结果表明所述剩余信息中不包含语音信息,将所述第一身份子空间确定为所述解离后的身份子空间;

第二去除子单元,用于如果所述映射结果表明所述剩余信息中包含语音信息,通过所述鉴别器从所述第一身份子空间中去除所述剩余信息中包含的语音信息,直到得到不包含语音信息的第二身份子空间;

第二确定子单元,用于将所述第二身份子空间确定为所述解离后的身份子空间。

22.根据权利要求17所述的装置,其特征在于,所述第二解离单元,包括:第三去除子单元,用于通过所述通过鉴别器利用所述人脸身份特征向量从所述训练样本的身份子空间中去除人物身份信息,得到第三话语子空间;

第二映射子单元,用于通过第二分类器将所述第三话语子空间中包含的剩余信息映射到所述训练样本的身份子空间,得到映射结果;

第三确定子单元,用于如果所述映射结果表明所述剩余信息中不包含人脸身份信息,将所述第三话语子空间确定为所述解离后的话语子空间;

第四去除子单元,用于如果所述映射结果表明所述剩余信息中包含人脸身份信息,通过所述鉴别器从所述第三话语子空间中去除所述剩余信息中包含的人脸身份信息,直到得到不包含人脸身份信息的第四话语子空间;

第四确定子单元,用于将所述第四话语子空间确定为所述解离后的话语子空间。

23.根据权利要求19所述的装置,其特征在于,所述映射单元,还包括:分类子单元,用于通过第三分类器对所述音频特征向量对应的训练样本和所述话语特征向量对应的训练样本进行分类,得到分类结果;

第一训练子单元,用于根据所述分类结果,对第三分类器进行对抗训练;

第二训练子单元,用于当所述分类结果不为空时,继续对所述第三分类器进行对抗训练,直到所述分类结果为空,结束对所述第三分类器的对抗训练。

24.根据权利要求13所述的装置,其特征在于,所述第一处理模块,包括:第二获取单元,用于将所述第一文件输入解离后的身份子空间,获取所述第一文件对应的人脸身份特征向量;

第三获取单元,用于将所述第二文件输入解离后的话语子空间,获取所述第二文件对应的音频特征向量;

第一训练单元,用于根据所述人脸身份特征向量和所述音频特征向量合成预设视频,对所述预设视频进行对抗训练,得到合成的说话视频。

25.一种计算机存储介质,其特征在于,所述计算机存储介质上存储有计算机可执行指令,该计算机可执行指令被执行后,能够实现权利要求1至12任一项所述的方法步骤。

26.一种计算机设备,其特征在于,所述计算机设备包括存储器和处理器,所述存储器上存储有计算机可执行指令,所述处理器运行所述存储器上的计算机可执行指令时可实现权利要求1至12任一项所述的方法步骤。