python计算机视觉-BOF图像检索

最新推荐文章于 2022-06-19 23:36:41 发布

十一吐司

最新推荐文章于 2022-06-19 23:36:41 发布

阅读量1k

点赞数

文章标签： python

本文链接：https://blog.csdn.net/www_mmmmmm/article/details/117623420

版权

本文介绍了基于内容的图像检索技术，特别是Bag of Features (BOF)模型。通过提取SIFT特征，使用K-Means构造视觉单词表，将图像转化为直方图表示，并实现BOF图像检索。实验结果显示，该方法能有效识别图像的形状、纹理和颜色相似性。

摘要由CSDN通过智能技术生成

BOF图像检索

图像检索基本概述

从20世纪70年代开始，有关图像检索的研究就已开始，当时主要是基于文本的图像检索技术(简称TBIR)，利用文本描述的方式描述图像的特征，如绘画作品的作者、年代、流派、尺寸等。
到90年代以后，出现了对图像的内容语义，如图像的颜色、纹理、布局等进行分析和检索的图像检索技术，即基于内容的图像检索(简称CBIR)技术。CBIR属于基于内容检索(简称CBR)的一种，CBR中还包括对动态视频、音频等其它形式多媒体信息的检索技术。
在检索原理上，无论是基于文本的图像检索还是基于内容的图像检索，主要包括三方面：一方面对用户需求的分析和转化，形成可以检索索引数据库的提问;另一方面，收集和加工图像资源，提取特征，分析并进行标引，建立图像的索引数据库;最后一方面是根据相似度算法，计算用户提问与索引数据库中记录的相似度大小，提取出满足阈值的记录作为结果，按照相似度降序的方式输出。
为了进一步提高检索的准确性，许多系统结合相关反馈技术来收集用户对检索结果的反馈信息，这在CBIR中显得更为突出，因为CBIR实现的是逐步求精的图像检索过程，在同一次检索过程中需要不断地与用户进行交互。

Bag of words模型

要了解「Bag of Feature」，首先要知道「Bag of Words」。
「Bag of Words」是文本分类中一种通俗易懂的策略。一般来讲，如果我们要了解一段文本的主要内容，最行之有效的策略是抓取文本中的关键词，根据关键词出现的频率确定这段文本的中心思想。比如：如果一则新闻中经常出现「iraq」、「terrorists」，那么，我们可以认为这则新闻应该跟伊拉克的恐怖主义有关。而如果一则新闻中出现较多的关键词是「soviet」、「cuba」，我们又可以猜测这则新闻是关于冷战的（见下图）。
在这里插入图片描述
这里所说的关键词，就是「Bag of words」中的 words ，它们是区分度较高的单词。根据这些 words ，我们可以很快地识别出文章的内容，并快速地对文章进行分类。
而「Bag of Feature」也是借鉴了这种思路，只不过在图像中，我们抽出的不再是一个个「word」，而是图像的关键特征「Feature」，所以研究人员将它更名为「Bag of Feature」。

Bag of features （BOF）

BOF算法流程

1、收集图片，对图像进行sift特征提取。
2、从每类图像中提取视觉词汇，将所有的视觉词汇集合在一起
3、利用K-Means算法构造单词表。
K-Means算法是一种基于样本间相似性度量的间接聚类方法，此算法以K为参数，把N个对象分为K个簇，以使簇内具有较高的相似度，而簇间相似度较低。SIFT提取的视觉词汇向量之间根据距离的远近，可以利用K-Means算法将词义相近的词汇合并，作为单词表中的基础词汇
4、针对输入的特征集，根据视觉词典进行量化，把输入图像转化成视觉单词的频率直方图。
5、构造特征到图像的倒排表，通过倒排表快速索引相关图像。
6、根据索引结果进行直方图匹配。

提取图像特征

特征必须具有较高的区分度，而且要满足旋转不变性以及尺寸不变性等，因此，我们通常都会采用「SIFT」特征。「SIFT」会从图片上提取出很多特征点，每个特征点都是 128 维的向量。

训练字典

提取完特征后，我们会采用一些聚类算法对这些特征向量进行聚类。最常用的聚类算法是 k-means。
聚类完成后，我们就得到了这 k 个向量组成的字典，这 k 个向量有一个通用的表达，叫 visual word。
在这里插入图片描述

图片直方图表示

上一步训练得到的字典，是为了这一步对图像特征进行量化。对于一幅图像而言，我们可以提取出大量的「SIFT」特征点，但这些特征点仍然属于一种浅层（low level）的表达，缺乏代表性。因此，这一步的目标，是根据字典重新提取图像的高层特征。

具体做法是，对于图像中的每一个「SIFT」特征，都可以在字典中找到一个最相似的 visual word，这样，我们可以统计一个 k 维的直方图，代表该图像的「SIFT」特征在字典中的相似度频率。
在这里插入图片描述

实现BOF图像检索

代码

提取图像的 SIFT特征点：

# -*- coding: utf-8 -*-
import pickle
from PCV.imagesearch import vocabulary
from PCV.tools.imtools import get_imlist
from PCV.localdescriptors import sift

#获取图像列表
# imlist = get_imlist('D:/pythonProjects/ImageRetrieval/first500/')
imlist = get_imlist('flowers')
nbr_images = len(imlist)

#获取特征列表
featlist = [imlist[i][:-3]+'sift' for i in range(nbr_images)]

#提取文件夹下图像的sift特征
for i in

最低0.47元/天解锁文章

十一吐司

关注

0
点赞
踩
8

收藏

觉得还不错? 一键收藏
2
评论
python计算机视觉-BOF图像检索

BOF图像检索图像检索基本概述Bag of words模型Bag of features （BOF）BOF算法流程提取图像特征训练字典图片直方图表示实现BOF图像检索代码运行结果图像检索基本概述从20世纪70年代开始，有关图像检索的研究就已开始，当时主要是基于文本的图像检索技术(简称TBIR)，利用文本描述的方式描述图像的特征，如绘画作品的作者、年代、流派、尺寸等。到90年代以后，出现了对图像的内容语义，如图像的颜色、纹理、布局等进行分析和检索的图像检索技术，即基于内容的图像检索(简称CBIR)技术。
复制链接

扫一扫