1.一种基于特征融合与注意力嵌入的低照度图像增强方法,其特征在于包括下列步骤:本方法包括三个模块:特征提取模块、U型Former模块和细节恢复模块;首先,特征提取模块利用具有不同色域的三个颜色空间来提取浅层特征,从而保留丰富的颜色和细节信息;此外,将通道注意力机制引入U型Former结构,以弥补空间维度信息交互的不足,防止通道维度信息的丢失,抑制噪声放大;最后,为了解决大多数现有方法中仅使用L1损失函数而导致的模型表达能力不足的问题,选择了四个损失函数并在LOL数据集上进行训练;
损失函数包括SmoothL1损失函数、结构相似性损失函数、空间一致性损失函数和感知损失函数;
SmoothL1损失是L1损失函数的改进版本,SmoothL1表达式为:
其中a为平衡系数,x为模型参数;LSL1为SmoothL1损失函数的计算结果,该函数精准地计算图像单像素间的相似性,它结合了L1和L2损失函数的优点,在总的损失函数中占主导地位;
结构相似性损失函数Lssim:
其中,xi和yi分别表示待测图像和标签图像的第i个像素;N表示图像的像素数量;为防止公式中分母为0,添加常数C1、C2;公式中的均值μ可以衡量图像的全局亮度,方差σ则反映了不同像素值的差异;在视觉领域可以衡量单张图像的对比度信息;协方差σxy衡量待测图像和标签图像之间的像素差异;Lssim表示结构相似性损失函数;因此,引入结构相似性损失函数,将会使得生成的图像在视觉感受上有着更大的相似度;
空间一致性损失函数Lspa不需要标签图像作参考,生成图像的较小局部区域内是光滑的;
其中,K为局部区域个数,Ω(i)是以像素i为中心的四个相邻区域,j表示Ω(i)内第j个像素,Y和I分别代表增强后图像和低照度图像,Lspa表示空间一致性损失函数的计算结果;
采用预训练VGG模型分别提取低照度图像和增强后图像的高级语义特征来计算它们之间的相似度Lper:
其中,j表示网络的第j层,φ(.)表示VGG预训练网络,CjHjWj表示第j层特征图的尺寸大小,Lper表示感知损失函数的计算结果;
本方法采用以上四种损失函数加权和作为总损失函数Ltotal,它的表达式为:
Ltotal=LSL1+αLssim+βLspa+γLper (6)
其中α,β,γ为平衡系数。
2.根据权利要求1所述的一种基于特征融合与注意力嵌入的低照度图像增强方法,其特征在于包括下列步骤:
具体步骤为:
CF-UFormer是一个端到端的基于Transformer的深度自编码器结构,包括特征提取模块、多级融合单元(MFU)和U型Fomer结构;具体为:低照度图像作为网络的输入,首先经过三条支路将原始图像转换到RGB、HSV和LAB颜色空间,获得了包括RGB在内的三种颜色空间的信息,随后采用级联的TransformerBlock将三者信息融合得到T0、T1和T2;为了防止信息丢失,将三路信息分别输入到多级融合单元(MFU),多级融合单元采用跳层连接来防止图像细节丢失的同时实现了多输入跨层信息融合,将融合后的按通道维拼接后输入到U型Fomer结构;U型Fomer结构的编码器部分由下采样和TransformerBlock交替四次组成,解码器部分由四次上采样和三个TransformerBlock交替连接,为了让网络自适应地关注信息更重要的维度,在第三次和第四次下采样后引入通道注意力机制;最后,将U型Fomer结构的输出与F1相加后输入到细节恢复模块,细节恢复模块模块依然采用级联的带有跳层连接和多级融合单元的Transformer机构,避免网络最后阶段的细节丢失;
特征提取模块通过在不同的颜色空间进行处理,得到色彩更真实的增强结果;特征提取模块包括三条并行的支路,每条支路将原始图像分别转换到RGB、HSV和LAB颜色空间;使用最频繁的RGB颜色空间和带有亮度通道的HSV和LAB颜色空间作为处理目标;
每个支路的结构细中的F代表颜色空间转换函数,随后的3个带有跳层连接的Transformer Block将对转换后的信息进行初步处理,为了避免前期图像细节丢失,采用多级融合单元(MFU)对3个TransformerBlock的输出进行特征融合;
使用了TransformerBlock代替了卷积操作,将融合三种颜色空间后的结果F0作为U型Fomer的输入,编码器部分使用下采样和TransformerBlock交替连接4次的方式得到分辨率缩减16倍的特征图;其中下采样每次将图像空间分辨率缩小2倍,通道维度数增加两倍,每一个阶段TransformerBlock的数目分别为{2,4,8,16},注意力头数为{1,2,4,8};当对图像进行第三次和第四次下采样后,此时的特征图维度数分别增加了8倍和16倍,各通道所包含的语义信息有差别,网络在前向传播过程中会忽略一些重要信息,因此引入通道注意力机制来解决这一问题;解码器部分与编码器操作相反,包括四次上采样和三个阶段,每次上采样图像空间分辨率增大两倍,通道维度数量缩小两倍,每一个阶段TransformerBlock的数目分别为{2,4,8},注意力头数为{1,2,4};
通道注意力机制将特征图投影到高维空间处理后再映射回原始大小得到注意力图,该注意力图与输入特征图各维度均相同,将作为注意力权重与特征图逐元素相乘得到最终结果;
采用了多级融合单元(MFU)来对不同信息进行保留和融合;将N个阶段的输入进行Reshape操作后进行自注意力计算,这和Transformer Block中的操作是类似的,多级融合单元只对支路维度进行融合,并不破坏各支路高宽维度的信息;特征提取模中的MFU目的是融合3个Transformer Block提取的底层特征,使每个颜色空间的特征图在输入到U型Fomer结构前得到更好地信息保留;细节恢复模块中的MFU则对U型Fomer结构的输出进一步处理,恢复由于下采样而丢失的细节信息;
本技术方案提出的改进的Transformer Block表示为:
其中Fin为TransformerBlock的输入,LN表示层归一化操作,A-MSA(.)表示轴自注意力机制,F′表示带有跳层连接的轴自注意力机制的输出,DGFN(.)表示双门控前馈网络;Fout为TransformerBlock的输出;
本技术方案中采用轴自注意力机制,相比原始ViT对图像所有像素之间做自注意力计算,本方法只沿高度和宽度两个方向进行计算,这将极大地缩减注意力机制的计算量;
多轴自注意力部分包括高度、宽度和通道维操作依次级联,首先将输入的特征图通过三个支路的1×1卷积和深度可分离卷积映射得到Q、K、V,接下来对Q和K进行Reshape操作后相乘得到注意力权重矩阵,注意力矩阵高宽和原特征图通道数相同,最后将此注意力权重矩阵与V在通道维度相乘得到与原特征图大小相等的输出;
双门控前馈网络(DGFN),首先在两条并行路径上应用深度可分离卷积和GELU后相乘,接下来对两条支路的输出求和,最后的1×1卷积操作结合残差连接保证信息的完整性;
提出了一个综合加权损失函数,三种全参考损失函数指导网络生成和标签在单像素和结构上更相似的结果,另外一种无参考损失函数则利用先验知识对图像进行优化调整。