1.一种基于语义图网络的医疗预测方法,其特征在于,具体包括如下步骤:S1、对医疗文本数据进行预处理;
S2、将预处理后的医疗文本数据进行特征提取;
S3、将提取的特征进行多粒度特征融合,得到最终的文档特征;
S4、将所述最终的文档特征进行慢性疾病预测;
所述步骤S2中的特征提取包括:实体特征提取、词特征提取、语义关系特征提取和属性‑值特征提取;
所述语义关系特征提取和属性‑值特征提取包括:
采用图卷积网络和图注意力网络来构建语义关系图,并定义基于知识的图表示和基于文本的图表示的两种类型子图;所述基于知识的图表示是利用领域本体中标记的实体之间的关系,并采用图卷积网络和图注意力网络来提取电子病历文本中实体关系;
所述基于知识的图表示:首先,基于医疗本体识别出电子病历中包含的实体和实体之K K间的关系作为图的节点和边,分别记作V和E,采用{h1,h2,...,h|n|}表示节点{v1,v2,...,v|n|}的特征, 其中i≠j,表示节点vi和vj在本体中有对应的关系r,K K K K K
然后基于|V|和|E|构建知识图表示模型G={V,E};
K
接下来定义邻接矩阵A,基于知识的邻接矩阵由公式(5)表示:在得到邻接矩阵之后,首先采用图卷积网络学习节点表示,如公式(6)所示:K K K
其中, D为A的度矩阵,是一个对角矩阵, W 和B表示K(t‑1)
权重和偏置参数, ReLU表示非线性激活函数,H 表示K
H上一层的特征;
在图卷积层之后结合领域本体中的实体关系,采用图注意力层提取基于知识的节点表示,如有节点特征 通过图注意力层将产生一个新的节点表示集合作为输出 F′表示输出特征的维度,图注意力层将在每一个节点采用权重矩阵参数化共享的线性转换, 并采用共享的注意力机制计算注意力系数,如公式(7)所示:其中, 表示句子中由实体对vi和vj构成的图Φ在领域本体中有关系r,Er表示r的关系向量,Wb表示权重, 接下来采用公式(8)来正则化相邻节点的权重得分:其中, 表示节点vi的邻居节点,并有关系r,最后通过公式(9)得出结合知识图表示后节点vi的特征,并采用 表示电子病例中包含的知识图表示,结合K
得到电子病历的知识图G,如公式(10)所示:
基于文本的图表示,对于不能从领域本体中找到对应关系的实体或词,根据Bi‑GRU提取的上下文中词之间的依赖关系,直接采用图卷积网络模型和图注意力网络提取词或实体C C C C之间的关系;采用图卷积模型提取基于文本的图表示,G={V,E};邻接矩阵A由公式(11)表示,采用图卷积网络学习节点表示如公式(12)所示:C C C C
其中, D为A的度矩阵,是一个对角矩阵, W和B表示权重和偏置参数;然后采用图注意力网络更新节点vp的表示,如公式(13)所示:接下来采用公式(14)来正则化相邻节点的权重得分,最后采用公式(15)计算实体或词vp和vq的图表示,其中,||表示向量拼接操作,LeakyRelu表示非线性激活函数,Nj表示vp的邻居节点,表示电子病历中包含的文本图,集合图 获得文本图表示C
G,如公式(16)所示:
属性‑值分为两种类型:疾病‑时间和检查‑检查结果,对于疾病‑时间,如有疾病实体vo和其对应的时间vs,疾病‑时间的属性‑值表示为 检查‑检查结果中属性‑值之间的关系表达方式和疾病‑时间相同,采用 表示属性‑值中的其中一个图,获得文档中属性‑值的图,如公式(17)所示:
在属性‑值特征的抽取过程中,首先识别句子中包含的数值及类别值,然后通过Bi‑GRU学习值的上下文信息,并提取与值距离最近的实体为其对应的属性特征。
2.根据权利要求1所述的基于语义图网络的医疗预测方法,其特征在于,所述步骤S1具体为:S11、根据需要预测的目标类别,将所述医疗文本数据进行人工标注,并载入领域本体;
S12、根据标点符号、数字和空格符,将所述医疗文本数据切分成汉字字符串,并去除停用词。
3.根据权利要求1所述的基于语义图网络的医疗预测方法,其特征在于,所述实体特征提取具体为:首先,将预处理后的医疗文本数据映射到领域本体,并通过最大匹配法将所述医疗文本数据切分成语义集;然后从所述语义集中找到与之相匹配的实体集和与所述实体集相对应的实体类型集,得到实体自身特征和实体类型特征;最后将所述实体自身特征和所述实体类型特征相结合来提取实体特征。
4.根据权利要求1所述的基于语义图网络的医疗预测方法,其特征在于,所述词特征提取和属性‑值特征提取具体为:采用Bi‑GRU来找出医疗文本数据中的词序列之间的依赖关系,并将词之间的序列信息放入图注意力网络中来识别语义关系,并提取属性‑值特征。
5.根据权利要求1所述的基于语义图网络的医疗预测方法,其特征在于,所述步骤S3具体为:将提取出来的实体特征、词特征、语义关系特征和属性‑值特征进行特征融合,得到最终的文档特征。
6.根据权利要求1所述的一种基于语义图网络的医疗预测方法,其特征在于,所述步骤S4具体为:将所述文档特征输入到softmax层进行医疗预测,并基于真实标签和预测标签的交叉熵计算损失函数,得到疾病类型的分类结果和疾病等级的预测结果。
7.根据权利要求1‑6所述的任意一项的基于语义图网络的医疗预测方法的基于语义图网络的医疗预测系统,其特征在于,包括:数据预处理模块、特征提取模块、多粒度特征融合模块、疾病类型分类器模块;
所述数据预处理模块的输出端与所述特征提取模块的输入端相连;所述特征提取模块的输出端与所述多粒度特征融合模块的输入端相连;所述多粒度特征融合模块的输出端与所述疾病类型分类器模块输入端相连;
所述数据预处理模块用于将医疗文本数据根据要预测的目标类别进行人工标注,并载入领域本体;还用于将医疗文本数据根据标点符号、数字和空格符进行汉字字符串切分,并去除停用词;
所述特征提取模块用于提取医疗文本数据中的实体特征、词特征、语义关系特征和属性‑值特征;
所述多粒度特征融合模块用于将提取出来的实体特征、词特征、语义关系特征和属性‑值特征进行融合作为softmax层的输入来进行疾病预测;
所述疾病类型分类器模块用于产生疾病类型的分类结果。
8.根据权利要求7所述的基于语义图网络的医疗预测系统,其特征在于,所述特征提取模块又包括四个子模块,分别为:实体特征提取模块、词特征提取模块、语义关系特征提取模块和属性‑值特征提取模块;
所述实体特征提取模块与所述词特征提取模块相连,所述词特征提取模块与所述属性‑值特征提取模块相连;所述属性‑值特征提取模块与所述语义关系特征提取模块相连;
所述实体特征提取模块用于将处理后的医疗文本映射到医疗本体中,分别提取概念自身特征和概念类型特征,并将概念自身特征和概念类型特征相结合来提取概念特征;
所述词特征提取模块用于将不能从医疗本体中找到与之相匹配的概念进行上下文中词序列特征的BiGRU学习;
所述语义关系特征提取模块用于在领域本体中找到对应关系类别的实体对和在领域本体不能找到对应关系类别的实体对;
所述属性‑值特征提取模块用于提取疾病‑时间和检测‑检查结果之间的关系。