天池:零基础入门CV赛事- 街景字符编码识别
赛题理解
- 赛题名称:零基础入门CV之街道字符识别
- 赛题目标:通过这道赛题可以引导大家走入计算机视觉的世界,主要针对竞赛选手上手视觉赛题,提高对数据建模能力。
- 赛题任务:赛题以计算机视觉中字符识别为背景,要求选手预测街道字符编码,这是一个典型的字符识别问题。
赛题数据
赛题来源自Google街景图像中的门牌号数据集(The Street View House Numbers Dataset, SVHN),并根据一定方式采样得到比赛数据集。
数据集报名后可见并可下载,该数据来自真实场景的门牌号。训练集数据包括3W张照片,验证集数据包括1W张照片,每张照片包括颜色图像和对应的编码类别和具体位置;为了保证比赛的公平性,测试集A包括4W张照片,测试集B包括4W张照片。

需要注意的是本赛题需要选手识别图片中所有的字符,为了降低比赛难度,我们提供了训练集、验证集和测试集中字符的位置框。
字段表
所有的数据(训练集、验证集和测试集)的标注使用JSON格式,并使用文件名进行索引。如果一个文件中包括多个字符,则使用列表将字段进行组合。
| Field | Description |
|---|---|
| top | 左上角坐标X |

本文介绍了天池的零基础计算机视觉赛事,聚焦街景字符编码识别。通过对Google街景数据集SVHN的采样,提供训练、验证和测试数据,要求参赛者预测街道字符编码。数据集包含字符位置信息,评测标准为整体识别准确率。解决思路涉及将字符位置识别作为先决条件,可应用物体检测模型如SSD或YOLO。
最低0.47元/天 解锁文章
633

被折叠的 条评论
为什么被折叠?



