欢迎来到知嘟嘟! 联系电话:13336804447 卖家免费入驻,海量在线求购! 卖家免费入驻,海量在线求购!
知嘟嘟
我要发布
联系电话:13336804447
知嘟嘟经纪人
收藏
专利号: 2022107211192
申请人: 安徽工业大学
专利类型:发明专利
专利状态:已下证
专利领域: 计算;推算;计数
更新日期:2026-07-29
缴费截止日期: 暂无
价格&联系人
年费信息
委托购买

摘要:

权利要求书:

1.一种基于深度互学习的多标记零样本学习方法,其特征在于:包括以下步骤:S1、获取图像视觉特征,即加载预训练的深度卷积神经网络提取图像特征;获取标签语义,即加载预训练的GloVe模型提取标签语义信息;

S2、设计一个语义微调模块,用于对利用GloVe模型提取出的标签语义信息进行细化或微调,使得提取到的标签语义信息更准确;

S3、设计融合图像区域与图像区域之间相关性的子网络1:利用多头自注意力机制,将图像中每个区域都与其它各区域相关联,得到基于区域的视觉特征表示;

S4、再将S3中得到的基于区域的视觉特征映射到语义空间中,计算标签的置信度分数,即每个标签出现在该图像中的概率;

S5、设计融合标签语义与图像特征之间相关性的子网络2:将标签语义信息与视觉特征相关联,得到基于语义的视觉特征表示;

S6、再将S5中得到的基于语义的视觉特征同样映射到语义空间中,计算标签的置信度分数,即每个标签出现在该图像中的概率;

S7、利用深度互学习技术,设计互学习损失,使得在训练过程中,两个子网络在训练自身分类性能的同时能够互相学习对方的训练经验,达到互相增强的效果;

S8、在测试时,给定一个测试样本,输入到S1‑S7训练得到的模型中,得到两个子网络的预测值,再将两个预测值加权求和进行融合,即可得到测试样本最终的预测值。

2.根据权利要求1所述的一种基于深度互学习的多标记零样本学习方法,其特征在于:步骤S1中,深度卷积神经网络提取图像特征记为xi∈χ,即 其中,表示实数域,h,w分别表示特征图的高和宽,d表示通道数;

S S

图像i的对应标签记为yi∈{0,1} ,训练集中图像对应的标签都属于已知类别集合。C表示已知类别集合,S表示已知类别的个数;

表示利用GloVe模型提取出的S个已知类别的语义向量,其中,da=300,用来表示S个已知类别的信息以及对它们之间的关系进行编码;

U

表示利用GloVe模型提取出的U个未知类别的语义向量,同样,da=300,C表S+U示未知类别集合,U表示未知类别的个数;C 表示同时包含已知类别和未知类别的集合。

3.根据权利要求2所述的一种基于深度互学习的多标记零样本学习方法,其特征在于:步骤S2中,语义微调模块Gv的设计方法为:利用一个可学习的3层感知机和ReLU激活函数构成语义微调模块Gv,其中将感知机的隐藏维度设为1024,输出维度设为300;

Vs=Gv(AS)    (1)

公式(1)中 是利用GloVe模型获取的类别语义向量; 是经过Gv模块微调的类别语义向量。

4.根据权利要求3所述的一种基于深度互学习的多标记零样本学习方法,其特征在于:步骤S3中,子网络1的设计方法为:

步骤一、首先将提取的图像特征 当作hw个区域特征,每个区域特征由d维组成,即 其中 表示图像i的第r个区域;将图像特征xi投影到低维空间d′中,其中d′=d/N;使用N个投影头创建查询向量、键向量、值向量,查询向量用来寻找与所有区域特征的键向量的相关性,值向量则保持每个区域特征当前形式的状态;每个区域特征都有自己的查询向量‑键向量‑值向量,将图像特征xi分别经过投影变换得到:公式(2)‑(4)中, n表示多头注意机制的投影头,n∈{1,2,...,N}; 表示可学习的投影权重;

步骤二、将每个查询向量寻找与来自hw个区域特征的所有键向量的相关性,可得到每个区域特征与其他各区域特征的相关性权重rn如下:公式(5)中 σ表示softmax激活函数,用来做归一化处理,使得权重值处在[0,1]之间; 表示对 做转置操作;

步骤三、利用公式(5)得到的权重值对值向量进行加权:公式(6)中 将公式(6)计算出的每个头的低维自注意特征沿着通道维度进行合并,最终得到基于区域的特征表示Fi:Fi=[α1;α2;...αN]Wf   (7)公式(7)中 表示可学习的权重参数;

与原始图像特征xi一致,基于区域的特征 作为hw个加权区域特征,每个加权区域特征由d维组成,即 其中 表示图像i中第r个区域的加权特征。

5.根据权利要求4所述的一种基于深度互学习的多标记零样本学习方法,其特征在于:步骤S4中,图像i中标签c的置信度分数可以计算为:公式(8)中 为步骤S3中得到的图像i中第r个区域的加权特征;c表示第c个标c签; 为标签c的分类器参数, 表示对θ做转置操作;图像中每个区域加权特征与标签c的分类器参数相乘,其中取最大值即为这里我们将每个标签分类器的参数表示为与该标签语义向量相关的函数:c

θ=VcWv   (9)

公式(9)中 表示经Gv模块微调得到的标签c的语义向量; 是可学习的权重参数。

6.根据权利要求5所述的一种基于深度互学习的多标记零样本学习方法,其特征在于:为了使每个图像中存在标签的分数大于不存在标签的分数,引入排名损失函数Lrank1:公式(10)中yi表示图像i对应的标签集合; 表示标签c出现在图像i中的置信度分数;

表示标签c′出现在图像i中的置信度分数。

7.根据权利要求1‑6中任一项所述的一种基于深度互学习的多标记零样本学习方法,其特征在于:步骤S5中,设计将标签语义信息与图像特征相融合的子网络2:公式(11)中 表示经Gv模块微调得到的标签c的语义向量; 是可学习的权重参数; 表示图像i的第r个区域特征, 表示对 做转置操作; 表示标签c在图像第r个区域的权重;

公式(12)中 表示经归一化得到的第c个标签语义在图像第r个区域特征上的权值;S表示已知类别个数;

公式(13)中 表示图像特征经标签c重新加权后的特征,则Fg={F1,F2,...,FS}表示经所有标签语义信息加权后的图像特征,即基于语义的视觉特征表示。

8.根据权利要求7所述的一种基于深度互学习的多标记零样本学习方法,其特征在于:步骤S6中,将步骤S5中得到的基于语义的视觉特征Fg同样映射到语义空间中,计算图像i中标签c置信度分数的方法为:公式(14)中 为S5中得到的基于标签语义c加权的特征;c表示第c个标签;

c

为标签c的分类器参数, 表示对θ做转置操作;

这里将每个标签分类器的参数表示为该标签语义向量的相关函数:c

θ=VcWv   (15)

公式(15)中 表示经Gv模块微调得到的标签c的语义向量;

是可学习的权重参数;

为了使每个图像中存在标签的分数大于不存在标签的分数,引入排名损失函数Lrank2:公式(16)中yi表示图像i对应的标签集合; 表示标签c出现在图像i中的置信度分数;

表示标签c′出现在图像i中的置信度分数。

9.根据权利要求8所述的一种基于深度互学习的多标记零样本学习方法,其特征在于:步骤S7中,引进深度互学习技术使两个子网络在训练过程中能够互相学习对方的训练经验,采用Jensen‑Shannon散度计算子网络1和子网络2的互学习损失Lmutual,如下:公式(17)中M表示训练集中的样本个数; 表示Kullback‑Leibler散度;

10.根据权利要求9所述的一种基于深度互学习的多标记零样本学习方法,其特征在于:步骤S8中,模型训练结束后,首先通过子网络1得到测试样本xi的基于区域的特征表示,通过子网络2得到测试样本xi的基于语义的特征表示,分别映射到语义空间中,得到每个标签出现在图像中的置信度分数即 和 然后使用一个组合权重系数(w1,w2)融合所得预测值,以得到测试样本xi中出现标签的最终预测值,公式如下:公式(18)中w1和w2表示两个概率分布的权重,经实验对比得到[w1,w2]组合;topk表示按照预测值大小排序,取前k个值的操作。