Multimodal Encoder-Decoder Attention Networks for Visual Question Answering论文笔记

这篇论文,作者提出了一个MEDA组成的MEDAN(多模态编码解码注意力网络)。

作者发现在共同注意中,在学习图像区域的细粒度特征时,首先学习问题引导注意特征与首先学习自我注意特征是不同的,后者可以获得更好的图像区域表示。原因可能是前者有助于理解图像,而后者更像是一个基于对图像的理解模块。

如上图所示,每个MEDA层都包括一个编码器模块和一个解码器模块(这里和transformer很像)。编码器的核心是一个文本自我注意单元,用来建模细粒度的文体特征;解码器主要包含一个问题引导注意单元和一个图像自注意单元,用来提取细粒度的图像区域特征。

模型流程

整个模型由三个模块组成,图像和问题的表示;多模态解码编码注意以及图像和问题特征的融合以及输出分类。

首先来看图像和问题的特征表示:

输入的图像通过faster-rcnn来提取特征,输入图像的特征被表示为V,这里V是k*2048,表示有k个目标区域。

输入的问题首先被标记为一个个单词,然后通过Glove得到词向量,然后经过LSTM获得问题特征E(u*512)。u是单词数量。

通常,我们将k和u固定为100和14(不够的使用0填充)

然后让V经过一个线性层,使其维度和问题特征相同。

多模态解码编码注意

解码编码都是基于上图这个transformer。

多头注意级联操作:

解码编码:

在编码器中,通过自注意学习问题特征。

首先将问题特征转化为qkv矩阵,如下所示

这个编码器主要用来学习问题中两个单词之间的相关性,下面为经过残差连接执行Add&Norm步骤

(LN为层归一化)

然后再经过Feed Forward(该层由具有relu函数的全连接层构成,并对其使用了dropout来防止过拟合),最后再通过Add&Norm得到加上注意力的问题特征

DECODER
这里来计算关于图像的特征,过程类似于问题特征,只是这里首先通过问题引导的注意力来计算图像特征。
经过编码器的问题特征E传入到解码器,经过变换得到k和v,图像特征V变换为Q。
以上为解码器的第一阶段,问题引导注意;下面是第二阶段,使用得到的图像注意力特征进行自我注意
和问题的自我注意步骤一样
 
 
IMAGE-QUESTION FEATURE FUSION AND OUTPUT CLASSIFIER
 
最终得到的问题特征经过softmax计算出每一个单词的权重,然后加权求和;计算图像特征的步骤也是一样的。
两个模态进行融合
f通过线性层改变输出维度(大小为训练集中出现频率最高的答案的个数),最后使用sigmod进行预测
 
 
在vqa2.0上的实验结果如下
 
 
 
摘要: 阿尔茨海默病(Alzheimer's disease,AD)是一种神经退行性疾病,是老年人口中最常见的病症之一。当前,基于磁共振成像(MRI)的多模态分析已成为诊断AD的重要辅助手段。然而,MRI数据中存在着大量的噪声和不确定性,且不同模态间的信息存在着差异,这给AD的诊断和分类带来了很大的挑战。本文提出了一种基于分层卷积神经网络(H-CNN)的多模态MRI分类方法。我们首先使用三种不同的MRI模态(T1加权、FLAIR和DWI)获取脑部结构、病变和功能信息,然后采用H-CNN对这些信息进行联合建模、特征提取和分类。实验结果表明,所提出的方法在AD分类任务上取得了最优的性能。 关键词: 阿尔茨海默病;多模态MRI;卷积神经网络;分层结构;分类 1. 简介 随着人口老龄化程度的不断加深,阿尔茨海默病(Alzheimer's disease,AD)已经成为老年人口中最为常见的失智症之一。AD主要表现为记忆力衰退、认知功能障碍和情绪不稳定等症状,严重影响患者的生活质量。目前,临床上主要采用神经心理学测试和影像学检查等手段对AD进行诊断和分类。其中,磁共振成像(MRI)已经成为一种非常重要的辅助诊断手段,它可以提供脑部结构、病变和功能等多方面的信息。 然而,MRI数据中存在着大量的噪声和不确定性,且不同模态间的信息存在着差异,这给AD的诊断和分类带来了很大的挑战。为了克服这些困难,近年来研究人员提出了许多基于机器学习和深度学习的AD分类方法。其中,卷积神经网络(CNN)已经被广泛应用于MRI数据的处理和分析。CNN可以自动从数据中学习特征,并且对噪声和不确定性具有较强的鲁棒性。 然而,目前的大多数CNN模型都是针对单一模态的MRI数据进行设计的,这限制了它们的分类性能。为了更好地利用MRI数据中的多模态信息,我们提出了一种基于分层卷积神经网络(H-CNN)的多模态MRI分类方法。我们使用三种不同的MRI模态(T1加权、FLAIR和DWI)获取脑部结构、病变和功能信息,然后采用H-CNN对这些信息进行联合建模、特征提取和分类。实验结果表明,所提出的方法在AD分类任务上取得了最优的性能。 2. 相关工作 近年来,基于机器学习和深度学习的AD分类方法已经得到了广泛的研究。其中,CNN是一种非常常用的深度学习模型,已经被应用于MRI数据的处理和分析。例如,Sarraf和Tofighi[1]提出了一种基于3D-CNN的AD分类方法,该方法可以从三维MRI数据中提取特征并进行分类。Wang等人[2]提出了一种基于深度卷积神经网络(DCNN)的AD分类方法,该方法可以自动学习MRI数据中的特征并进行分类。Li等人[3]提出了一种基于深度信念网络(DBN)的AD分类方法,该方法可以对MRI数据进行降维和特征提取,并且可以处理多模态MRI数据。 尽管这些方法在AD分类任务中取得了一定的成功,但它们都是针对单一模态的MRI数据进行设计的,而忽略了MRI数据中的多模态信息。为了更好地利用MRI数据中的多模态信息,一些研究人员提出了基于多模态MRI数据的AD分类方法。例如,Li等人[4]提出了一种基于多模态脑图像的AD分类方法,该方法可以联合处理T1加权和FLAIR模态的MRI数据。Zhang等人[5]提出了一种基于多模态MRI数据的AD分类方法,该方法可以联合处理T1加权、T2加权和FLAIR模态的MRI数据。 然而,这些方法仍然存在一些问题。首先,它们通常采用简单的模型结构,无法充分利用MRI数据中的多模态信息。其次,它们的特征提取过程通常是手工设计的,无法自动学习MRI数据中的特征。最后,它们的分类性能仍然有待进一步提高。 3. 方法 为了更好地利用MRI数据中的多模态信息,我们提出了一种基于分层卷积神经网络(H-CNN)的多模态MRI分类方法。我们使用三种不同的MRI模态(T1加权、FLAIR和DWI)获取脑部结构、病变和功能信息,然后采用H-CNN对这些信息进行联合建模、特征提取和分类。 具体来说,我们首先将三种不同的MRI模态分别输入到三个单独的卷积神经网络中,以进行局部特征提取。然后,我们采用一个分层卷积神经网络(H-CNN)将这些局部特征进行联合建模。H-CNN由多个卷积层和池化层组成,每个卷积层和池化层都包含多个子层。在每个子层中,我们使用不同的卷积核和池化核来提取不同尺度的特征。最后,我们将H-CNN的输出传递给全连接层,并使用softmax函数对其进行分类。 4. 实验结果 为了评估所提出的方法的性能,我们使用了一个包含200名AD患者和200名正常对照组的数据集。我们将数据集分为训练集、验证集和测试集,其中训练集和验证集用于模型训练和调优,测试集用于评估模型的性能。我们使用了准确率、召回率、F1值和AUC等指标来评估模型的性能。 实验结果表明,所提出的方法在AD分类任务上取得了最优的性能。具体来说,我们的方法在测试集上的准确率、召回率、F1值和AUC分别为93.2%、91.8%、92.5%和0.974,远高于其他方法。这表明,我们的方法可以有效地利用MRI数据中的多模态信息,并且具有较强的分类性能。 5. 结论 本文提出了一种基于分层卷积神经网络(H-CNN)的多模态MRI分类方法,该方法可以有效地利用MRI数据中的多模态信息,并且具有较强的分类性能。实验结果表明,所提出的方法在AD分类任务上取得了最优的性能。未来,我们将进一步改进该方法,并将其应用于其他相关疾病的诊断和分类。
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值