论文题目:You Only Look Once: Unified, Real-Time Object Detection
论文地址:https://arxiv.org/abs/1506.02640
RCNN系列都是先生成候选区域,在对候选区域进行分类回归,YOLO提出了一种不同方式,直接像CNN分类那样进行端到端的网络。输入一整张图片经过YOLO以后输出98个候选框的移动量,与属于哪一类的概率。
将输入图片划分成7*7个grid cell,每个grid cell 预测两个bbox。一共就有49个grid cell,所以一共预测98个。为什么要说这些呢?因为期望的输出是通过这些grid cell产生的。即损失函数里面的标记值是GT与grid cell一起产生的。
具体请看原文。