1.一种知识图谱的优化方法,其特征在于,包括以下步骤:S1、采用分布式爬虫从多个数据源中获取多个文本数据;
S2、从获取的每个文本数据中提取实体、实体间的关系以及实体的属性;
S3、根据从每个文本数据中提取的所述实体间的关系对所述实体进行连接,构建得到对应的初始图谱;
S4、根据结合软注意力的图卷积神经网络对所述初始图谱进行融合,得到融合优化后的知识图谱;
S5、将所述知识图谱储存在Neo4j图数据库中。
2.根据权利要求1所述的优化方法,其特征在于,所述步骤S4和步骤S5之间还包括:S6、采用聚类算法对所述知识图谱中的属性进行聚类,并根据聚类结果向所述知识图谱中添加新的实体,得到扩展最优的知识图谱。
3.根据权利要求1所述的优化方法,其特征在于,所述步骤S2具体包括:S21、根据所述文本数据对应的目标领域的语料特点构建规则库;
S22、采用自然语言处理算法对所述文本数据进行预处理,得到预处理后的文本数据;
S23、根据所述规则库从预处理后的文本数据中提取实体、实体间的关系以及实体的属性。
4.根据权利要求1所述的优化方法,其特征在于,所述步骤S4具体包括:S41、根据两个初始图谱中关系三元组的信息确定邻接矩阵;
S42、将随机初始化的邻接矩阵输入第一个图卷积神经网络进行训练,得到实体基于关系的嵌入向量;
S43、根据两个初始图谱中属性三元组的信息确定连接矩阵;
S44、将采用软注意力初始化的连接矩阵输入第二个图卷积神经网络进行训练,得到实体基于属性的嵌入向量;
S45、根据实体基于关系的嵌入向量和实体基于属性的嵌入向量,分别计算实体基于关系和属性的相似性并进行加权求和,得到实体间相似性;
S46、根据实体间的相似性将对齐实体对进行对齐,得到扩展后的知识图谱。
5.根据权利要求3所述的优化方法,其特征在于,所述实体间的相似性的表达式为:r
其中,ei,ej为对齐的实体对,0<α<1为超参数,用于平衡两种嵌入向量的重要性;e为实v体基于关系的嵌入向量,e为实体基于属性的嵌入向量;dr、dv分别表示最后输出的实体基于关系和属性的嵌入向量的维度;wiv表示属性的权重。
6.根据权利要求2所述的优化方法,其特征在于,所述步骤S6具体包括:S61、根据K‑means聚类算法对所述知识图谱中的属性进行聚类,得到聚类结果;
S62、根据每个所述聚类结果对应的所述知识图谱中实体的连接关系,确定每个所述聚类结果的离散度,其中,所述离散度是指所述知识图谱中的近邻实体的属性在所述聚类结果中的离散程度;
S63、根据所述离散度从聚类结果中提取属性作为新实体添加至所述知识图谱中,得到最优的知识图谱。
7.根据权利要求3所述的优化方法,其特征在于,所述预处理是指根据所述文本数据的结构特点以及词形特点进行过滤和修改,完成数据归一化。
8.一种用于实现上述权利要求1‑7任一项所述的知识图谱的优化方法的系统,其特征在于,包括:数据获取模块(10),所述数据获取模块(10)用于采用分布式爬虫从多个数据源中获取多个文本数据;
数据处理模块(20),所述数据处理模块(20)用于从获取的每个文本数据中提取实体、实体间的关系以及实体的属性;
初始图谱构建模块(30),所述初始图谱构建模块(30)用于根据从每个文本数据中提取的所述实体间的关系对所述实体进行连接,构建得到对应的初始图谱;
图谱融合优化模块(40),所述图谱融合优化模块(40)用于根据结合软注意力的图卷积神经网络对所述初始图谱进行融合,得到融合优化后的知识图谱;
图谱储存模块(50),所述图谱储存模块(50)用于将所述知识图谱储存在Neo4j图数据库中。
9.根据权利要求8所述的优化系统,其特征在于,还包括:图谱扩展优化模块(60),所述图谱扩展优化模块(60)用于采用聚类算法对所述知识图谱中的属性进行聚类,并根据聚类结果向所述知识图谱中添加新的实体,得到扩展最优的知识图谱。
10.一种储存介质,其特征在于,所述储存介质有多条指令,所述指令适于处理器进行加载,以执行如权利要求1‑7任一项所述的方法。