【实践】端到端的OCR：验证码识别

最新推荐文章于 2024-06-05 14:46:28 发布

一寒惊鸿

最新推荐文章于 2024-06-05 14:46:28 发布

阅读量2.5w

点赞数 1

分类专栏：深度学习文章标签：深度学习

本文链接：https://blog.csdn.net/dengxing1234/article/details/73609204

版权

本文介绍了利用深度学习进行验证码识别的两种方法：基于CNN的多标签学习和基于LSTM+CTC的序列学习。通过去噪、二值化、字符识别等步骤，探讨了验证码识别的难点，特别是字符分割问题。实验结果显示，使用CNN的准确率可达95%，而LSTM+CTC适用于长度不固定的验证码，通过CTC损失函数实现有效训练。

摘要由CSDN通过智能技术生成

验证码识别的思路非常暴力，大概就是这样：

去噪＋二值化
字符分割
每个字符识别

验证码的难度在这3步上都有反应。比如

噪声：加一条贯穿全图的曲线，比如网格线，还有图的一半是白底黑字，另一半是黑底白字。
分割：字符粘连，7和4粘在一起。
识别：字符各种扭曲，各种旋转。

但相对而言，难度最大的是第2步，分割。所以就有人想，我能不能不做分割，就把验证码给识别了。深度学习擅长做端到端的学习，因此这个不分割就想识别的事情交给深度学习是最合适的。

基于CNN的验证码识别

基于CNN去识别验证码，其实就是一个图片的多标签学习问题。比如考虑一个4个数字组成的验证码，那么相当于每张图就有4个标签。那么我们把原始图片作为输入，4个标签作为输出，扔进CNN里，看看能不能收敛就行了。

下面这段代码定义了mxnet上的一个DataIter，我们用了python-captcha这个库来自动生成训练样本，所以可以假设训练样本是无穷多的。

class OCRIter(mx.io.DataIter):
def __init__(self, count, batch_size, num_label, height, width):
    super(OCRIter, self).__init__()
    self.captcha = ImageCaptcha(fonts=['./data/OpenSans-Regular.ttf'])
    self.batch_size = batch_size
    self.count = count
    self.height = height
    self.width = width
    self.provide_data = [('data', (batch_size, 3, height, width))]
    self.provide_label = [('softmax_label', (self.batch_size, num_label))]

def __iter__(self):
    for k in range(self.count / self.batch_size):
        data = []
        label =

最低0.47元/天解锁文章

一寒惊鸿

关注

1
点赞
踩
2

收藏

觉得还不错? 一键收藏
1
评论
【实践】端到端的OCR：验证码识别

验证码识别的思路非常暴力，大概就是这样：去噪＋二值化字符分割每个字符识别验证码的难度在这3步上都有反应。比如噪声：加一条贯穿全图的曲线，比如网格线，还有图的一半是白底黑字，另一半是黑底白字。分割：字符粘连，7和4粘在一起。识别：字符各种扭曲，各种旋转。但相对而言，难度最大的是第2步，分割。所以就有人想，我能不能不做分割，就把验证码给识别了。深度学习擅长做端到端的学习，因
复制链接

扫一扫

专栏目录