赛题数据
赛题的数据为街景字符图片,类似于MNIST数据集,但是更加困难,每张图片分辨率都很低,图片中的字符有大有小,存在尺度不一致的问题;按照赛题的要求只要识别是每张图片包含几个字符,每个字符是什么就可以了,这样可以简单将其定义为一个图像分类问题,但是每个图片的字符个数不确定,而且位置不确定,因为每个字符的类别仅仅与相应的局部的特征有关,仅仅通过对全局的特征进行分类并不能得到很好的效果;并且通过亲自实验, 完成baseline代码的阅读和理解,并完成在训练集训练10个epoch, 效果很差
其次赛题数据不仅提供了字符类别也提供了每个字符的位置信息,所以也可以将改题定义为目标检测问题,利用同时分类和回归的多任务损失,对每个指定位置进行针对性的分类和回归,两种任务进行相互促进,彼此收益可以取得更好的效果.
问题
如果采用目标检测的思路,个人认为应该选取针对小目标的backbone作为特征提取器,要包含多尺度的特征融合的策略,检测头的话可以采用当前精度比较好的anchor free方法这样可以避免复杂的关于anchor超参的设计,同时可以支持多尺度的边界框回归