这是一篇NIPS2016中有关目标检测的文章,虽然有点老,但是其free anchor的思想还是值得借鉴。尤其今年和free anchor相关的目标检测研究大火,但其大多是从先探测物体的中心点或者是关键点,由点到面从而学习到精确的轮廓或者位置信息。
一、研究动机
受人眼观察世界方式的启发:我们首先将我们的视线集中在一幅图片的显著位置,通过对该区域的信息提取有助于将我们的视线转移到相关区域直到完全理解图片将图片所有目标搜索完毕。同样对于目标检测其而言,在大幅图片上聚焦于信息丰富且有目标物集中的区域并且将其放大,通过训练一个智能体能够在一个图片中实现定义的五个窗口选出一个进行放大检测,该放大区域也会同样地延续刚才的选择步骤,如此递归直至将目标物框出。整个过程将图片按层次结构进行不断切分放大检测。
这和基于滑窗的目标检测方法不同之处在于:滑窗并没有考虑图片块之间的联系,而是对每个块展开独立的分析。而我们的智能体通过层次结构来表示图片从而很好的考虑到块之间的联系。与此同时不需要非极大值抑制的后处理,关键是减少了检测区域。
二、研究贡献
(1)采用一种自顶向下的树状搜索机制指导智能体搜索目标位置,对比了两种窗口设置的方式:有重叠和无重叠,探究了层次结构的设定与放大区域个数的设置对检测效果的影响。