1.一种高速列车问题查询模板生成方法,其特征在于,包括问题浅度判定和问题深度判定;
所述问题浅度判定包括如下步骤:
步骤S11:分词及停词;将用户问句输入jieba分词器进行分词处理;其中,将预先构建好的词典输入分词器中完成领域专有名词的识别;将分词后的分词序列输入到停词表中,如果某一词在停词表内,则将其视为非核心词去除,保留用户问句的主要成分形成用于特征提取的词序列;所述预先构建好的词典包括:从高速列车领域知识图谱中导出所有实体形成的实体词典;手工构建实体的相关同义词形成的同义词词典;从高速列车领域知识图谱中导出所有本体标签形成的本体标签词典;
步骤S12:特征提取及融合;将步骤S11中获得的词序列转化为词向量特征、句型特征以及用户特征三方面的特征词向量形式并将其融合为特征总向量;其中,词向量特征表示问句词语级的特征,由预训练词向量得来;句型特征表示问句句子结构的特征,由词序列的词性序列得来;用户特征表示用户级的特征,由用户信息、用户日志得来;
步骤S13:将用户问句转换为特征总向量的形式后,将特征总向量输入到分类模型里进行问题类别预测,最终输出用户问句的语义方向标签;其中,分类模型选用svm支持向量机;
所述问题深度判定包括如下步骤:
步骤S21:构建问句模板以及查询模板以形成与语义方向标签对应的模板库;其中,问句模板用于匹配用户问句深层语义,查询模板用于实现查询映射;
步骤S22:匹配模板库;将步骤S13中输出的语义方向标签用作模板库匹配的依据,当匹配到储存有相同语义方向标签的模板库后,输出模板库中所有的问句模板用于用户问句匹配;
步骤S23:句法分析及词性标注;对用户问句做句法分析得到句法分析结果,然后再对用户问句做词性标注得到词性序列,替换句法分析结果中非实体节点为对应词性标签,替换实体节点为对应本体,得到用户问句的词性句法分析树;
步骤S24:问句模板匹配;将步骤S23中得到的用户问句的词性句法分析树与步骤S22中提取的问句模板依次进行相似度匹配,将相似度最大的问句模板作为用户问句所匹配上的对象;
步骤S25:查询映射;将步骤S24中匹配到的相似度最大的问句模板对应的查询模板提取出来,将其作为用户问句的查询模板,实现查询的转换。
2.如权利要求1所述的一种高速列车问题查询模板生成方法,其特征在于,所述步骤S12具体包括如下步骤:步骤S121:将预训练词向量导入分词、停词后形成的词序列中,并将词序列中每个词的预训练词向量加权平均后得出用户问句的词向量特征w_vector(A),其计算公式如下:式中:A为分词、停词后的词序列;w_vector(A)为A的词向量特征;i为A的序列长度;n表示词向量的维度;Asn表示A中第s个词的词向量第n个位置的数值;
步骤S122:采用ltp词性标注工具对用户问句做词性标注后由词性替换用户问句中的词语得到问句的词性序列,将词性序列代入句型词典中进行匹配,根据匹配到的索引确定问句的句型向量,如果在句型词典中无匹配项,则在句型向量最后一位之后补位并置1,得到用户问句的句型特征s_vector(A),其计算公式如下:式中:A为分词、停词后的词序列;s_vector(A)为A的句型特征;pos(A)代表A词性标注的结果;dict代表句型词典;n代表句型词典的长度;dict(n)代表词典中最后一个句型;
代表已成功匹配并舍弃该补位;
步骤S123:根据用户信息、用户日志获取用户特征u_vector(A);其中,用户信息来源于用户身份,以用户身份的个数作为特征向量维度;用户日志由问题类别数作为向量维度,以用户是否搜索过某类问题作为数值;
步骤S124:特征融合;采用直接拼接的方式将词向量特征、句型特征以及用户特征融合成特征总向量,其计算公式如下:vector(A)=(w_vector(A),s_vector(A),u_vector(A))式中:A代表分词、停词后的词序列;w_vector(A)为A的词向量特征;s_vector(A)为A的句型特征;u_vector(A)为A的用户特征;vector(A)为A的特征总向量。
3.如权利要求2所述的一种高速列车问题查询模板生成方法,其特征在于,所述步骤S21包括:步骤S211:句法分析;利用哈工大ltp句法分析工具对训练问句进行句法分析操作,将训练问句输入到ltp句法分析工具当中,并输出该训练问句中各词语间的句法关系;
步骤S212:词性标注;利用哈工大ltp词性标注工具对训练问句进行词性标注操作,将训练问句输入到ltp词性标注工具当中,并输出训练问句每个词对应的词性标签组成的词性序列;
步骤S213:实体去除;将训练问句的句法分析结果中属于实体的词语替换成其在知识图谱中对应的本体,将非实体词替换成其词性标注结果中对应的词性标签,形成词性句法分析树,得到问句模板;
步骤S214:实体抽取;为训练问句补充上相对应的知识图谱中的答案,并且依据实体抽取识别出训练问句以及其对应答案中的实体;
步骤S215:构建查询图;将步骤S214中问句实体以及答案实体用作知识图谱检索的条件,检索出在知识图谱中包含两个实体的最小连通图,将该最小连通图作为该条训练语句的查询图;
步骤S216:实体去除;将步骤S215中查询图中的问句实体节点依据其实体类型变为可替换的变量节点,实体类型包括结构实体、故障实体、原因实体、维修方法实体以及本体标签;将答案实体节点替换成其在知识图谱中对应本体,得到训练问句对应的查询模板。
4.如权利要求3所述的一种高速列车问题查询模板生成方法,其特征在于,所述步骤S23具体包括:步骤S231:用户问句的句法分析;利用哈工大ltp句法分析工具对用户问句进行句法分析操作,将用户问句输入到ltp句法分析工具当中,并输出该用户问句中各词语间的句法关系;
步骤S232:用户问句的词性标注;利用哈工大ltp词性标注工具对用户问句进行词性标注操作,将用户问句输入到ltp词性标注工具当中,并输出用户问句每个词对应的词性标签组成的词性序列;
步骤S233:实体去除;将用户问句的句法分析结果中属于实体的词语替换成其在知识图谱中对应的本体,将非实体词替换成其词性标注结果中对应的词性标签,形成用户问句的词性句法分析树。
5.如权利要求4所述的一种高速列车问题查询模板生成方法,其特征在于,所述步骤S24还包括:采用树编辑距离计算相似度,根据同层之间节点插入、删除、修改的总步数作为树编辑距离,树编辑距离越小则其相似度越大,其计算公式如下:s=max(dep(X),dep(D))
式中:X代表用户问句词性句法分析树;D代表问句模板;lev_tree(X,D)代表X与D之间的树编辑距离;s代表X与D之间的最大树高;Xi,Di代表X和D的第i层;dn(Xi,Di)代表Xi转换成Di需要删除的节点个数;in(Xi,Di)代表Xi转换成Di需要插入的节点个数;mn(Xi,Di)代表Xi转换成Di需要修改的节点个数;dr(Xi,Di)代表Xi转换成Di需要删除的边个数;ir(Xi,Di)代表Xi转换成Di需要插入的边个数;mr(Xi,Di)代表Xi转换成Di需要修改的边个数;dep(X)、dep(D)代表树X和树D的高度。