多模态目标检测
目标检测的多模态通常是图像与文本这两者。
1. 视觉信息输入:「图像编码器 Image Encoder」接收图像并提取特征,得到「图像特征 Image Feature」;
2. 文本描述输入:「文本编码器 Text Encoder」接收与图像关联的「文本 Text」并进行编码,得到「文本嵌入 Text Embedding」。文本可以是图像中的物体描述或场景描述,一般称为Prompt。
-
文本嵌入的长度通常是固定的,有个训练参数可以设置
embeddings size
3. 跨模态融合:将「图像特征 Image Feature」和「文本嵌入 Text Embedding」融合起来增强「文本和图像表示 Text and Image Represention」,以便模型更全面地理解目标。
4. 目标检测:将融合后的信息用于目标检测,确定图像中存在的目标,以及它们的位置、类别。