1.一种基于弹幕文本的问题集获取方法,其特征在于,包括:获取所选定的目标视频数据在上一个弹幕采集周期内的弹幕文本数据集;
将所述弹幕文本数据集中每一条弹幕文本数据输入至预先训练的文本语句类型识别模型,得到与每一条弹幕文本数据对应的文本语句类型,获取所述弹幕文本数据集中文本语句类型为疑问句的弹幕文本数据组成目标弹幕文本数据集;
按所述目标弹幕文本数据集中每一条目标弹幕文本数据对应的弹幕发送时间以及与所述目标视频数据对应的多个时间划分段,依时间升序统计各时间划分段分别对应的目标弹幕文本数据数量,组成问题数量时间序列;
通过对所述问题数量时间序列进行拐点检测,得到拐点检测结果集;
获取所述拐点检测结果集中的上升拐点以及每一上升拐点对应的时间划分段,由每一上升拐点对应的时间划分段进行组合得到目标时间划分段集;
通过对所述目标时间划分段集中每一目标时间划分段对应的目标弹幕文本数据子集分别进行文本聚类,得到与每一目标时间划分段对应的文本聚类结果;
获取每一文本聚类结果中文本聚类数量降序排名未超出预设的排名阈值对应的聚类文本,组成与每一文本聚类结果分别对应的目标聚类文本子集;以及获取每一目标时间划分段对应的时间段、时间段视频数据、以及目标聚类文本子集,组成与每一目标时间划分段对应的混合数据集,将混合数据集发送至目标用户端。
2.根据权利要求1所述的基于弹幕文本的问题集获取方法,其特征在于,所述获取每一目标时间划分段对应的时间段、时间段视频数据、以及目标聚类文本子集,组成与每一目标时间划分段对应的混合数据集,将混合数据集发送至目标用户端之后,还包括:接收目标用户端发送的与每一混合数据集分别对应的答复数据,将每一混合数据集的答复数据增加至对应目标时间划分段的时间段视频数据中,得到与所述目标视频数据对应的答疑视频数据。
3.根据权利要求1所述的基于弹幕文本的问题集获取方法,其特征在于,所述文本语句类型识别模型是支持向量机分类模型;
所述将所述弹幕文本数据集中每一条弹幕文本数据输入至预先训练的文本语句类型识别模型,得到与每一条弹幕文本数据对应的文本语句类型,获取所述弹幕文本数据集中文本语句类型为疑问句的弹幕文本数据组成目标弹幕文本数据集之前,还包括:获取历史弹幕文本集作为样本集;
获取所述历史弹幕文本集中每一历史弹幕文本对应的句子向量;
获取每一历史弹幕文本对应的文本语句类型标注值;其中,文本语句类型为疑问句的弹幕文本标注值为1,文本语句类型为非疑问句的弹幕文本标注值为0;
将每一历史弹幕文本对应的句子向量作为待训练支持向量机分类模型的输入,将句子向量对应的标注值作为待训练支持向量机分类模型的输出对待训练支持向量机分类模型进行训练,得到支持向量机分类模型,并获取支持向量机分类模型对应的分类超平面。
4.根据权利要求1所述的基于弹幕文本的问题集获取方法,其特征在于,所述按所述目标弹幕文本数据集中每一条目标弹幕文本数据对应的弹幕发送时间以及与所述目标视频数据对应的多个时间划分段,依时间升序统计各时间划分段分别对应的目标弹幕文本数据数量,组成问题数量时间序列,包括:根据预先设置的时间窗口值将所述目标视频数据对应的目标视频时长进行划分,得到与所述目标视频时长对应的时间划分段集;
根据所述目标弹幕文本数据集中每一条目标弹幕文本数据对应的弹幕发送时间,统计获取所述时间划分段集中每一时间划分段内对应的目标弹幕文本数据子集;
按各目标弹幕文本数据子集对应的时间划分段的时间升序顺序,依序统计每一目标弹幕文本数据子集对应的弹幕数量,组成问题数量时间序列。
5.根据权利要求1所述的基于弹幕文本的问题集获取方法,其特征在于,所述通过对所述问题数量时间序列进行拐点检测,得到拐点检测结果集,包括:调用预先存储的二分分割模型,并获取所述二分分割模型对应的损失函数;
通过二分分割模型获取所述问题数量时间序列中满足使得所有问题数量值对应的总体损失为最小值的目标问题数量值,组成拐点检测结果集。
6.根据权利要求1所述的基于弹幕文本的问题集获取方法,其特征在于,所述通过对所述目标时间划分段集中每一目标时间划分段对应的目标弹幕文本数据子集分别进行文本聚类,得到与每一目标时间划分段对应的文本聚类结果,包括:获取第i个目标时间划分段中第i组目标弹幕文本数据子集中包括的目标弹幕文本;其中,i的初始值为1,且i的取值范围是[1,k],k的取值与目标时间划分段集中所包括目标时间划分段的总个数相等;
获取第i组目标弹幕文本数据子集中包括的目标弹幕文本分别对应的句子向量;
将第i组目标弹幕文本数据子集对应的每一句子向量根据预先训练的高斯混合模型进行聚类,得到第i组目标弹幕文本数据子集对应的第i组文本聚类结果;
将i自增1更新i值,判断i是超出k;若i未超出k,返回执行所述获取第i个目标时间划分段中第i组目标弹幕文本数据子集中包括的目标弹幕文本的步骤;
若i超出k,结束流程。
7.根据权利要求2所述的基于弹幕文本的问题集获取方法,其特征在于,所述将每一混合数据集的答复数据增加至对应目标时间划分段的时间段视频数据中,得到与所述目标视频数据对应的答疑视频数据,包括:将每一混合数据集的答复数据的原始文本数据或是超链接地址增加至对应目标时间划分段的时间段视频数据中,得到对应的答疑视频数据。
8.一种基于弹幕文本的问题集获取装置,其特征在于,包括:弹幕数据集获取单元,用于获取所选定的目标视频数据在上一个弹幕采集周期内的弹幕文本数据集;
目标弹幕文本获取单元,用于将所述弹幕文本数据集中每一条弹幕文本数据输入至预先训练的文本语句类型识别模型,得到与每一条弹幕文本数据对应的文本语句类型,获取所述弹幕文本数据集中文本语句类型为疑问句的弹幕文本数据组成目标弹幕文本数据集;
问题数量时间序列获取单元,用于按所述目标弹幕文本数据集中每一条目标弹幕文本数据对应的弹幕发送时间以及与所述目标视频数据对应的多个时间划分段,依时间升序统计各时间划分段分别对应的目标弹幕文本数据数量,组成问题数量时间序列;
拐点检测单元,用于通过对所述问题数量时间序列进行拐点检测,得到拐点检测结果集;
目标时间划分段集获取单元,用于获取所述拐点检测结果集中的上升拐点以及每一上升拐点对应的时间划分段,由每一上升拐点对应的时间划分段进行组合得到目标时间划分段集;
文本聚类结果获取单元,用于通过对所述目标时间划分段集中每一目标时间划分段对应的目标弹幕文本数据子集分别进行文本聚类,得到与每一目标时间划分段对应的文本聚类结果;
目标聚类文本子集获取单元,用于获取每一文本聚类结果中文本聚类数量降序排名未超出预设的排名阈值对应的聚类文本,组成与每一文本聚类结果分别对应的目标聚类文本子集;以及
混合数据集获取单元,用于获取每一目标时间划分段对应的时间段、时间段视频数据、以及目标聚类文本子集,组成与每一目标时间划分段对应的混合数据集,将混合数据集发送至目标用户端。
9.一种计算机设备,包括存储器、处理器及存储在所述存储器上并可在所述处理器上运行的计算机程序,其特征在于,所述处理器执行所述计算机程序时实现如权利要求1至7中任一项所述的基于弹幕文本的问题集获取方法。
10.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质存储有计算机程序,所述计算机程序当被处理器执行时使所述处理器执行如权利要求1至7任一项所述的基于弹幕文本的问题集获取方法。