1.一种基于内容感知的视频摘要生成方法,其特征在于,包括以下步骤:S1,通过特征编码器将视频帧编码为帧级特征向量;
S2,构建视频摘要生成模型预测帧级重要性分数,所述视频摘要生成模型包括:特征增强模块,所述特征增强模块将帧级特征向量作为输入,用于特征预增强,弥补每帧内容与视频整体内容之间的关系鸿沟;
上下文建模模块,所述特征增强模块的输出作为所述上下文建模模块的输入,所述上下文建模模块用于挖掘输入视频序列的全局和局部上下文信息,充分理解视频内容;动态上下文融合模块,所述上下文建模模块的输出作为所述动态上下文融合模块的输入,所述动态上下文融合模块用于融合不同语义尺度的上下文信息,避免由语义尺度差异产生的融合不充分的问题;
重要性分数预测模块,所述动态上下文融合模块的输出作为所述重要性分数预测模块的输入,所述重要性分数预测模块用于回归帧级重要性分数;
S3,采用监督学习的学习范式训练所述视频摘要生成模型,包括:计算帧级重要性分数和人工标签值之间的均方误差作为目标损失函数;
采用Adam网络优化器更新所述视频摘要生成模型中的网络参数;
S4,选择包含最多关键信息的子镜头,输出动态视频摘要。
2.根据权利要求1所述的一种基于内容感知的视频摘要生成方法,其特征在于,构建所述特征增强模块,包括:对帧级特征序列和视频级特征序列进行矩阵乘法,得到每一帧与视频内容的语义相关性得分,经过softmax函数输出注意力分数;
将所述注意力分数与帧级特征向量进行逐元素相乘得到增强特征向量。
3.根据权利要求2所述的一种基于内容感知的视频摘要生成方法,其特征在于,所述视频级特征被定义为所述帧级特征的平均值。
4.根据权利要求1所述的一种基于内容感知的视频摘要生成方法,其特征在于,构建所述上下文建模模块,包括:通过自注意力机制在完整的视频序列上建模,挖掘输入视频中的全局上下文信息;
通过卷积运算在局部窗口内挖掘输入视频中丰富的局部上下文信息。
5.根据权利要求4所述的一种基于内容感知的视频摘要生成方法,其特征在于,挖掘所述局部上下文信息通过提前设置不同的局部窗口大小完成,并采用深度可分离卷积以降低运算复杂度。
6.根据权利要求1所述的一种基于内容感知的视频摘要生成方法,其特征在于,构建所述动态上下文信息融合模块,包括:根据逐元素相加计算初始上下文特征;
第一融合路径,所述第一融合路径采用卷积操作聚合局部的初始融合上下文特征;
第二融合路径,所述第一融合路径采用全局平均池化和卷积操作聚合全局的初始上下文信息;
将所述第一融合路径和所述第二融合路径的输出进行逐元素相加并依次经过归一化层和Sigmoid层输出融合系数,并执行特征融合,输出融合的上下文特征。
7.根据权利要求1所述的一种基于内容感知的视频摘要生成方法,其特征在于,构建所述重要性分数预测模块,包括第一全连接层,ReLU层,归一化层,Dropout层,第二全连接层和Sigmoid层。
8.根据权利要求1所述的一种基于内容感知的视频摘要生成方法,其特征在于,所述选择包含最多关键信息的子镜头,输出动态视频摘要,包括:通过KTS镜头分割算法检测视频镜头,平均每个镜头内的重要性分数,得到镜头级重要性得分;
规定摘要最大时长,采用动态规划算法获取最优解。