1.一种BERT模型的预训练方法,包括:获取训练数据;
获取同义词知识图谱;
对所述同义词知识图谱进行词向量嵌入处理得到知识矩阵;
根据所述训练数据确定掩模矩阵;
加载BERT模型,所述BERT模型包括多个注意力机制模块;
对于每个所述注意力机制模块,将所述训练数据、所述知识矩阵以及所述掩模矩阵输入至所述注意力机制模块进行处理,得到所述注意力机制模块的输出结果;
将全部所述注意力机制模块的输出结果进行字符串拼接和线性化处理,得到语义向量;
根据所述语义向量与所述掩模矩阵确定训练损失值;
根据所述训练损失值对部分或全部所述注意力机制模块的网络参数进行调整。
2.根据权利要求1所述的BERT模型的预训练方法,其特征在于,所述将所述训练数据、所述知识矩阵以及所述掩模矩阵输入至所述注意力机制模块进行处理,得到所述注意力机制模块的输出结果,包括:
获取所述训练数据对应的查询矩阵、键矩阵和值矩阵;
将所述查询矩阵、所述键矩阵和所述值矩阵输入至所述注意力机制模块,使得所述注意力机制模块对所述查询矩阵、所述键矩阵和所述值矩阵进行参数调整;
根据所述掩模矩阵、所述知识矩阵、调整后的查询矩阵和调整后的键矩阵确定注意力分值;
对所述注意力分值进行逻辑回归处理得到逻辑回归结果;
将所述逻辑回归结果与调整后的值矩阵的乘积作为所述注意力机制模块的输出结果。
3.根据权利要求1所述的BERT模型的预训练方法,其特征在于,所述获取同义词知识图谱,包括:
从WordNet知识库中获取多个词语;
标记所述多个词语之间的关系,其中,所述关系包括同义关系或非同义关系;
以各个所述词语作为实体,根据各个所述实体之间的关系,建立所述同义词知识图谱。
4.根据权利要求3所述的BERT模型的预训练方法,其特征在于,所述对所述同义词知识图谱进行词向量嵌入处理得到知识矩阵,包括:使用TransE算法,获取所述同义词知识图谱中的各个所述实体的词向量;
以所述词向量作为元素,组成所述知识矩阵。
5.根据权利要求3所述的BERT模型的预训练方法,其特征在于,在将所述训练数据、所述知识矩阵以及所述掩模矩阵输入至所述注意力机制模块进行处理之前,所述方法还包括:
对所述知识矩阵中的各个所述词向量进行如下变换:ωei=TanH(W2*Relu(W1*wkei));
其中,wkei为所述知识矩阵中的第i个所述词向量变换前的值,ωei为所述知识矩阵中的第i个所述词向量变换后的值,W1和W2设定的为权重系数矩阵。
6.根据权利要求2所述的BERT模型的预训练方法,其特征在于,所述根据所述掩模矩阵、所述知识矩阵、调整后的查询矩阵和调整后的键矩阵确定注意力分值,包括:使用如下公式根据所述掩模矩阵、所述知识矩阵、调整后的查询矩阵和调整后的键矩阵确定注意力分值;
Q K T
socres=QWi(KWi) ⊙G+MASK;
Q K
其中,socres表示所述注意力分值,Q表示所述查询矩阵,K表示所述键矩阵,Wi和Wi 表示第i个所述注意力机制模块的参数,G表示所述知识矩阵,MASK表示所述掩模矩阵,⊙表示矩阵逐元素相乘运算。
7.根据权利要求6所述的BERT模型的预训练方法,其特征在于,所述对所述注意力分值进行逻辑回归处理得到逻辑回归结果,包括:根据所述键矩阵的维度值,对所述注意力分值进行归一化处理;
将经过归一化处理的所述注意力分值输入到softmax分类器,得到所述softmax分类器的输出值;
将所述softmax分类器的输出值作为逻辑回归结果。
8.根据权利要求1至7任一项所述的BERT模型的预训练方法,其特征在于,所述BERT模型包括的所述注意力机制模块的数量与所述知识矩阵的规模正相关。
9.一种计算机装置,其特征在于,包括存储器和处理器,所述存储器用于存储至少一个程序,所述处理器用于加载所述至少一个程序以执行权利要求1至8任一项所述的BERT模型的预训练方法。
10.一种存储介质,其中存储有处理器可执行的程序,所述处理器可执行的程序在由处理器执行时用于执行如权利要求1至8任一项所述的BERT模型的预训练方法。