1.一种基于多层次的特征注意力的方面级情感分类方法,其特征在于,包括:S1:获取文本数据的文本信息和方面词信息,对文本信息和方法词信息分别进行词嵌入编码,得到文本词向量和方面词向量;
S2:将待预测情感极性的方面词进行相对位置编码,将位置编码与文本词向量进行融合,得到融合位置信息的文本词向量;
S3:采用双向门控循环单元网络LSTM分别对融合位置信息的文本词向量和方面词向量进行预处理,得到融合位置信息的文本词序列和方面词序列;
S4:将融合位置信息的文本词序列和方面词序列进行交互处理,得到文本词序列和方面词序列的交互信息;
S5:提取交互信息的句子级别的注意力信息;
S6:对方面词序列进行平均池化处理,采用注意力机制将池化后的方面词序列和融合位置信息的文本词序列进行处理,得到全局注意力的文本特征信息;
S7:采用卷积神经网络CNN提取全局注意力的文本特征信息的局部特征,得到文本局部的特征注意力信息;
S8:将句子级别的注意力信息、全局注意力的文本特征信息和文本局部的特征注意力信息进行融合,得到融合信息;
S9:采用全连接层和softmax归一化指数函数对融合信息进行编码处理,得到最终的分类结果。
2.根据权利要求1所述的一种基于多层次的特征注意力的方面级情感分类方法,其特征在于,得到文本词向量和方面词向量的具体过程包括:步骤1:获取输入文本数据的集合信息s={s1,s2,s3,…,sn},提取输入文本数据的集合信息中待预测极性的方面词,对方面词进行集合,得到待预测极性的方面词集合信息t={t1,t2,t3,…,tm};
步骤2:采用预训练的word2vec模型对待预测极性的方面词集合信息进行处理,生成文本词向量编码 和方面词向量编码
其中,sn表示输入文本数据集合中的文本信息,n表示文本包含的单词数,tm表示待预测极性的方面词集合的文本信息,m表示方面词包含的单词数,dw表示词向量的维度。
3.根据权利要求1所述的一种基于多层次的特征注意力的方面级情感分类方法,其特征在于,得到融合位置信息的文本词向量的过程包括:采用相对位置编码函数对文本词向量编码和方面词向量编码进行相对位置编码,得到位置嵌入矩阵;在模型的训练过程中对位置嵌入矩阵进行初始化和更新,得到文本位置向量;将文本向量与文本位置向量连接,得到融入位置信息的文本向量。
4.根据权利要求1所述的一种基于多层次的特征注意力的方面级情感分类方法,其特征在于,得到融合位置信息的文本词序列和方面词序列的过程包括:将融入位置信息的文本词向量xi与方面词向量vt分别输入各自的双向LSTM网络中,得到融入位置信息的文本词序列Hx和方面词序列Ht;所述双向LSTM网络由遗忘门ft和输入门it以及输出门ot组成,遗忘门ft决定隐藏状态需要丢弃哪些信息,输入门it决定要将哪些隐藏状态更新为新的状态,输出门ot决定要输出哪些更新后的隐藏状态。
5.根据权利要求4所述的一种基于多层次的特征注意力的方面级情感分类方法,其特征在于,双向LSTM网络的计算公式为:词向量xi经过双向LSTM后的矩阵为:其中,表示向量拼接操作,xi表示词向量, 表示前向LSTM计算, 表示后向LSTM计算, 表示矩阵Hx的维度是n×2dh,Hx表示融入位置信息的词向量序列。
6.根据权利要求1所述的一种基于多层次的特征注意力的方面级情感分类方法,其特征在于,提取交互信息的句子级别的注意力信息的过程包括:S51:将交互信息I通过列softmax得到方面词‑句子的注意力信息αij;将交互信息I通过行softmax得到得到句子‑方面词级别的注意力信息βij;
S52:将句子‑方面词级别的注意力信息βij按列求平均,得到方面词级别的注意力信息S53:根据方面词级别的注意力信息 和方面词‑句子的注意力信息αij计算句子级别注意力信息。
7.根据权利要求1所述的一种基于多层次的特征注意力的方面级情感分类方法,其特征在于,得到全局注意力的文本特征信息的过程包括:S61:将方面词序列信息Ht通过平均池化操作得到池化后的方面词信息Htavg;
S62:根据池化后的方面词信息Htavg计算方面词信息在上下文中的重要程度;
S63:根据方面词信息在上下文中的重要程度,采用注意力机制对池化后的方面词信息Htavg和融入位置信息的文本词序列Hx进行处理,得到上下文对方面词的全局注意力信息δi;
S64:根据上下文对方面词的全局注意力信息δi计算单词的注意力权值,得到全局注意力的文本特征信息Hr。
8.根据权利要求7所述的一种基于多层次的特征注意力的方面级情感分类方法,其特征在于,计算全局注意力信息δi和全局注意力的文本特征信息Hr的公式为:其中,score表示得分函数, 表示融入位置信息的文本词序列,Htavg表示池化后的方面词信息。
9.根据权利要求1所述的一种基于多层次的特征注意力的方面级情感分类方法,其特征在于,得到文本局部的特征注意力信息的公式为:Cx=CNN(Hr)
ci=g(w×si:i+k‑1+b)其中,ci表示特征映射中第i个特征值,g表示非线性激活函数,b表示偏置量,w表示N网络中的权重矩阵,si:i+k‑1表示文本序列中第i个词到第i+k‑1个词的长度,表示矩阵Cx的维度为2dn×(n‑k+1)维。
10.根据权利要求1所述的一种基于多层次的特征注意力的方面级情感分类方法,其特征在于,融合信息的公式和分类结果公式为:融合信息的公式:
分类结果公式:
p=softmax(Wr+b)
其中,Hr表示文本全局的特征注意力信息,Cx表示文本局部的特征注意力信息,γ表示级别的注意力信息, 表示向量拼接操作,W为softmax层的权重矩阵,b为softmax层的偏置项。