1.一种社交图片文本识别方法,其特征在于,包括:获取社交图片的二维图像特征;
通过全局注意力交互机制对所述二维图像特征进行特征提取,得到二维视觉特征;
将所述二维视觉特征输入字符视觉特征模型,获得所述字符视觉特征模型输出的与所述二维视觉特征对应的一维字符视觉特征;
将所述一维字符视觉特征输入字符语义特征模型,获得所述字符语义特征模型得输出的与所述一维字符视觉特征对应的一维字符语义特征;
通过融合特征算法对所述一维字符视觉特征和所述一维字符语义特征进行动态融合处理,得到所述社交图片的字符信息;
所述通过全局注意力交互机制对所述二维图像特征进行特征提取,得到二维视觉特征,包括:对所述二维图像特征进行维度转换处理,得到与所述二维图像特征对应的一维图像特征,并记录所述二维图像特征与所述一维图像特征之间的位置编码;
将所述一维图像特征输入多头注意力机制,得到多头一维图像特征;
根据所述位置编码将所述多头一维图像特征进行维度转换处理,得到所述二维视觉特征;
所述将所述一维图像特征输入多头注意力机制,得到多头一维图像特征,包括:使用若干预设维度转化规则对所述一维图像特征进行处理,获得对应的若干一维向量,一个预设维度转化规则对应一个一维向量;
拼接所述若干一维向量,得到所述多头一维图像特征;
所述融合特征算法包括:
Fchar
a′
其中,Fchar
2.如权利要求1所述的社交图片文本识别方法,其特征在于,所述将所述二维视觉特征输入字符视觉特征模型,获得所述字符视觉特征模型输出的与所述二维视觉特征对应的一维字符视觉特征,包括:通过字符视觉特征模型对所述二维视觉特征进行字符识别,获取所述二维视觉特征中字符的字符位置;
根据所述字符位置提取所述二维视觉特征的一维字符视觉特征。
3.如权利要求2所述的社交图片文本识别方法,其特征在于,所述字符视觉特征模型包括:Vchar
其中,Vchar
4.如权利要求1所述的社交图片文本识别方法,其特征在于,所述获取社交图片的二维图像特征,包括:通过摄像头获取所述社交图片;
将所述社交图片输入预设网络进行预处理,得到所述社交图片的二维图像特征。
5.一种社交图片文本识别装置,其特征在于,包括:二维图像特征模块,用于获取社交图片的二维图像特征;
二维视觉特征模块,用于通过全局注意力交互机制对所述二维图像特征进行特征提取,得到二维视觉特征;
一维字符视觉特征模块,用于将所述二维视觉特征输入字符视觉特征模型,获得所述字符视觉特征模型输出的与所述二维视觉特征对应的一维字符视觉特征;
一维字符语义特征模块,用于所述一维字符视觉特征输入字符语义特征模型,获得所述字符语义特征模型得输出的与所述一维字符视觉特征对应的一维字符语义特征;
字符信息模块,用于通过融合特征算法对所述一维字符视觉特征和所述一维字符语义特征进行动态融合处理,得到所述社交图片的字符信息;
所述二维视觉特征模块,包括:
一维图像特征单元,用于对所述二维图像特征进行维度转换处理,得到与所述二维图像特征对应的一维图像特征,并记录所述二维图像特征与所述一维图像特征之间的位置编码;
多头一维图像特征单元,用于将所述一维图像特征输入多头注意力机制,得到多头一维图像特征;
二维视觉特征单元,用于根据所述位置编码将所述多头一维图像特征进行维度转换处理,得到所述二维视觉特征;
所述多头一维图像特征单元,包括:
一维向量单元,用于使用若干预设维度转化规则对所述一维图像特征进行处理,获得对应的若干一维向量;
一维向量拼接单元,用于拼接所述若干一维向量,得到所述多头一维图像特征;
所述融合特征算法包括:
Fchar
a′
其中,Fchar
6.一种计算机设备,包括存储器、处理器以及存储在所述存储器中并可在所述处理器上运行的计算机可读指令,其特征在于,所述处理器执行所述计算机可读指令时实现如权利要求1至4中任一项所述社交图片文本识别方法。
7.一种计算机可读存储介质,计算机可读指令被一个或多个处理器执行时,使得所述一个或多个处理器执行如权利要求1至4中任一项所述社交图片文本识别方法。