1.一种基于运动信息协助的视频摘要生成方法,其特征在于,包括以下步骤:S1,读取输入视频,获取用于反映静态视觉内容的外观帧序列和反映动态运动状态变化的运动帧序列;
S2,利用神经网络模型对外观帧序列和运动帧序列进行特征提取,获得帧级外观特征和帧级运动特征;
S3,利用镜头分割算法检测所述帧级外观特征中的视觉变化点,获取子镜头集合;
S4,构建视频摘要生成模型预测镜头级重要性得分,所述模型包括:序列编码器:所述序列编码器分别将所述帧级外观特征和所述帧级运动特征作为输入,用来将每个镜头内的特征聚合为镜头级特征向量以表征语义信息,最后输出镜头级外观特征和镜头级运动特征;
双向模态编码器:所述双向模态编码器将所述镜头级外观特征和所述镜头级运动特征作为输入,首先通过单模态特征编码挖掘镜头间的上下文依赖关系,再通过跨模态特征交互在外观流和运动流中进行消息传递,得到融合外观信息和运动信息的跨模态上下文特征;
视频语义引导器:所述视频语义引导器将所述帧级外观特征和所述跨模态上下文特征作为输入计算语义一致性损失,用来缓解运动流中的噪声影响,提升视频摘要性能;
分数预测器:所述分数预测器以所述跨模态上下文特征作为输入,用来将高维特征映射为重要性分数向量以表征每个镜头的重要性程度;
S5,构建目标函数,以无监督或者监督学习的方式训练所述视频摘要生成模型;
S6,使用 S5训练得到的视频摘要生成模型对新视频进行预测,根据得到的重要性得分向量生成动态视频摘要。
2.根据权利要求1所述的基于运动信息协助的视频摘要生成方法,其特征在于,所述序列编码器在外观流和运动流中共享权重。
3.根据权利要求1所述的基于运动信息协助的视频摘要生成方法,其特征在于,构建所述序列编码器,包括:利用正向门控循环单元和反向门控循环单元分别聚合每个镜头内短距离特征序列的正向和反向时序特征;
将所述正向门控循环单元和反向门控循环单元最终单元输出的隐藏层特征向量沿维度方向进行拼接,输出镜头级特征向量。
4.根据权利要求1所述的基于运动信息协助的视频摘要生成方法,其特征在于,构建所述双向模态编码器,包括:首先在外观流和运动流中进行单模态特征编码,通过注意力层动态地考虑镜头间的语义相关性挖掘镜头级特征间的上下文依赖关系,输出外观流编码特征和运动流编码特征;
将所述外观流编码特征作为查询特征,所述运动流编码特征作为键、值特征,使外观特征关注运动特征,通过注意力层得到外观‑运动跨模态上下文特征;
将所述运动流编码特征作为查询特征,所述外观流编码特征作为键、值特征,使运动特征关注外观特征,通过注意力层得到运动‑外观跨模态上下文特征;
将得到的外观‑运动以及运动‑外观跨模态上下文特征送入前馈神经网络学习深层特征,再经过相加得到所述跨模态上下文特征。
5.根据权利要求4所述的基于运动信息协助的视频摘要生成方法,其特征在于,所述双向模态编码器在单模态特征编码、跨模态特征交互以及深层特征传递阶段都包含残差连接,可以有效地避免网络退化的问题。
6.根据权利要求1所述的基于运动信息协助的视频摘要生成方法,其特征在于,构建所述视频语义引导器,包括:将所述跨模态上下文特征沿时间维度进行全局平均池化得到跨模态上下文特征向量;
利用注意力层聚合所述帧级外观特征中的长距离帧间上下文信息,再沿时间维度进行全局平均池化并经过归一化得到外观特征向量 ;
计算所述跨模态上下文特征向量和所述外观特征向量间的欧几里得距离作为所述语义一致性损失 ,公式表述为:,
其中, 表示L2范式。
7.根据权利要求1所述的基于运动信息协助的视频摘要生成方法,其特征在于,所述目标函数包括奖励函数项 、正则项 和语义一致性损失项 ,奖励函数项 可以由下式计算得到:,
其中,表示候选摘要, 表示余弦距离, 为镜头数量, 和 分别表示第t个和第i个镜头级外观特征;
正则项 计算如下:
,
其中, 表示第i个镜头的预测得分。
8.根据权利要求7所述的基于运动信息协助的视频摘要生成方法,其特征在于,当以监督学习的学习范式进行网络训练时,所述目标函数还应当包含均方误差损失 用于提升预测分数与标注分数之间的一致性,计算公式如下:,
其中, 表示第i个镜头的标注得分。