（NeurIPS，2022）Knowledge-CLIP：使用知识图谱进行CLIP

最新推荐文章于 2024-10-27 00:15:00 发布

lalula1999

最新推荐文章于 2024-10-27 00:15:00 发布

阅读量1.2k

点赞数 8

分类专栏： CLIP 文章标签：知识图谱人工智能

本文链接：https://blog.csdn.net/weixin_44386956/article/details/140298475

版权

文章目录

Contrastive Language-Image Pre-Training with Knowledge Graphs

Contrastive Language-Image Pre-Training with Knowledge Graphs

摘要

近年来，大规模预训练框架的发展迅速，这些框架能够以统一的形式提取多模态表征，并在转移到下游任务时展现出有希望的性能。然而，现有的方法主要关注简单的图像-文本对的预训练，而忽略了不同模态概念之间的语义联系。在本文中，我们提出了一个基于知识的知识预训练框架，称为Knowledge-CLIP，它将语义信息注入到广泛使用的CLIP模型中。通过在预训练过程中引入基于知识的目标，并使用不同类型的知识图谱作为训练数据，我们的模型能够在视觉和语言中以更高的质量对表征进行语义对齐，并增强跨场景和模态的推理能力。在各种视觉-语言下游任务上的广泛实验证明了Knowledge-CLIP与原始CLIP和具有竞争力的基线相比的有效性。

引言

请添加图片描述
用于预训练的数据对是以最简单的方式组织的，即仅使用匹配和不匹配的描述来表示给定图像和文本对之间的关系。这通常会导致一种退化的情况，即模型倾向于依赖输入的共同出现而非其语义。

我们遵循CLIP的结构，并使用两个基于Transformer的模型分别作为图像和文本编码器。这两个编码器以知识图谱中的实体和关系为输入，提取实体和关系的原始特征。值得注意的是，实体可以是图像/文本的形式，而关系则始终由语言标记描述。然后，采用多模态Transformer编码器来融合基于关系的实体特征。通过这种方式，预训练模型被推动集中于理解视觉和文字概念之间的语义关系，从而在视觉和语言模态之间建立强大的语义连接。

为进一步提高训练效率并避免预训练过程中的大量计算成本，我们采用了一种简单的持续学习策略，基于CLIP的预训练权重来训练我们的模型。这为使用低训练资源有效提升CLIP模型性能提供了可能性。

回顾CLIP

CLIP使用两个独立的模型分别作为图像编码器和文本编码器。
请添加图片描述

对于文本输入，采用了一个12层的Transformer，宽度为512，注意力头为8。原始文本首先使用字节对编码技术在49,152的词汇量下进行转换。文本序列长度限制在76，并在输入文本编码器之前添加位置编码。
另一方面，CLIP有基于ResNet和基于Vision Transformer的不同版本的图像编码器架构。由于后续研究表明Vision Transformer模型的性能更好，本文只考虑基于Transformer的图像编码器。与文本输入类似，图像首先被转换为块，并添加位置编码。

在两个编码器的最后阶段，采用全局池化函数将特征图压缩成单个特征，作为整个图像/文本序列的表示。计算图像和文本特征的余弦距离作为数据对的相似性。在训练监督中，采用对比损失来最大化匹配对的相似性，同时最小化不匹配对的相似性。

Knowledge-CLIP

请添加图片描述

我们提出了一个基于知识图谱的新型预训练框架，从几个角度解决了原始CLIP模型的限制：

我们将知识图谱引入训练数据集中，其中图结构数据和概念之间的语义关系使模型能够提取语义特征，并在输入之间建立语义连接；
在当前的图像和文本编码器之上增加了一个多模态编码器，以融合不同模态的特征，并建模输入之间的联合分布；
采用了基于CLIP预训练模型的持续学习策略，避免了预训练过程中的大量计算成本，并有效地增强了模型的泛化能力。

数据准备

请添加图片描述

与原始CLIP中使用的原始图像-文本对不同，我们的模型采用知识图谱作为输入。知识图谱可以定义为一个有向图G = {ξ, R, TR}，其中ξ, R分别对应实体和关系集，TR表示关系三元组的集合。三元组(h, r, t) ∈ TR表示实体h ∈ ξ与实体t ∈ ξ之间存在关系r ∈ R。如图3所示，我们在三种类型的知识图谱上预训练我们的模型，包括多模态知识图谱、场景图谱和基于语言的知识图谱。