利用深度学习(CNN)进行验证码(字母+数字)识别

本文方法针对的验证码为定长验证码,不包含中文。

本文的思路是:1. 使用keras中预训练好的模型,在python生成的验证码(5万条)上fine tune,得到python验证码模型;2. 使用python验证码模型,在实际验证码(500条)上fine tune;3. 增加样本,提高精度。

 

通俗的解释2个问题:

  1. keras中预训练好的模型是什么东西?

答: keras上有很多已经训练好的图像识别模型,诸如Alex Net,google net,VGG16,VGG19,ResNet50,Xception,InceptionV3,这些都是由ImageNet训练而来。那ImageNet又是什么的?ImageNet项目是一个用于视觉对象识别软件研究的大型可视化数据库,超过1400万的图像URL被ImageNet手动注释,以指示图片中的对象。说白了,上述已经训练好的图像识别模型是用来识别大千世界的各种物品的,如气球、草莓、汽车、楼房等等。这些个模型都能识别这么复杂的东西了,那我现在要识别一个验证码数据,岂不是很简单?这就是站在巨人的肩膀上,再微微调整一下模型就可以了。这其实就是迁移学习的概念。

  1. 为什么要先使用python生成得验证码进行fine tune?

答: 虽说我们站在巨人的肩膀上,利用已有的深度神经网络来微调我们的模型,但是从大千世界迁移到验证码图片,这两个样本集还是有很大的差别的。这就要求我们用“大量“的验证码数据再去训练我们的神经网络参数。这个”大量“我为什么用引号呢,因为其实只需要数万张(下文使用了5万)验证码图片就可以了,相对于ImageNet的1400万,这个数字其实很小,但是如果需要我们手工标记数万张验证码,那就是不小的工作量了。所以,我们先用python自动生成标记好的5万张验证码图片,先进行fine tune,保存好输出的模型,注意,这个模型已经不是识别大千世界的模型了,是识别数字和英文字母的模型了,但是直接应用于实际的验证码,效果还是很差,因为两种验证码长得不一样,然后我们进行再一次的迁移学习,再在我们手工标记好的、实际要识别的验证码(500条)进行fine tune,这样就可以识别很好的识别我们要识别的验证码了。

 

 

1. 利用python生成你所需要的验证码

       一般的验证码都为4位,由数字和大小写字母构成。利用python的captcha模块,生成5万张样本图片:

from captcha.image import ImageCaptcha
from random import randint

def gen_captcha(num,captcha_len):
    # # 纯数字,如果目标识别是10位数字,预训练用纯数字效果更好
    # list = [chr(i) for i in range(48, 58)]

    # # 10数字+26大写字母+26小写字母
    list = [chr(i) for i in range(48, 58)] + [chr(i) for i in range(65, 91)] + [chr(i) for i in range(97, 123)]

    for j in range(num):
        if j % 100 == 0:
            print(j)
        chars = ''
        for i in range(captcha_len):
            rand_num = randint(0, 61)
            chars += list[rand_num]
        image = ImageCaptcha().generate_image(chars)
        image.save('./train/' + chars + '.jpg')



num = 50000
captcha_len = 4
gen_captcha(num,captcha_len)

这样我们就轻松的获取到了5万张样本数据

 

2. 使用python生成的样本进行预训练

keras_weight中Alex Net,google net,VGG16,VGG19,ResNet50,Xception,InceptionV3。都是由ImageNet训练而来。这里使用Xception模型

Xception模型

参考keras文档:https://keras.io/zh/applications/#xception

keras.applications.xception.Xception(include_top=True, 
                                weights='imagenet', input_tensor=None, 
                                input_shape=None, pooling=None, classes=1000)

在 ImageNet 上预训练的 Xception V1 模型。

在 ImageNet 上,该模型取得了验证集 top1 0.790 和 top5 0.945 的准确率。

注意该模型只支持 channels_last 的维度顺序(高度、宽度、通道)。

模型默认输入尺寸是 299x299

参数

include_top: 是否包括顶层的全连接层。

weights: None 代表随机初始化, 'imagenet' 代表加载在 ImageNet 上预训练的权值。

input_tensor: 可选,Keras tensor 作为模型的输入(即 layers.Input() 输出的 tensor)。

input_shape: 可选,输入尺寸元组,仅当 include_top=False 时有效(否则输入形状必须是 (299, 299, 3),因为预训练模型是以这个大小

  • 23
    点赞
  • 147
    收藏
    觉得还不错? 一键收藏
  • 30
    评论
实现一个可学习的字母数字图片验证码识别程序需要以下步骤: 1. 数据集准备:收集足够数量的验证码样本,并将其划分为训练集和测试集。 2. 特征提取:从验证码图片中提取出有用的特征,比如颜色、形状、尺寸等。 3. 模型选择:选择合适的模型进行训练和预测,常用的模型包括卷积神经网络CNN)、循环神经网络(RNN)等。 4. 模型训练:使用训练集对模型进行训练,不断调整模型参数以提高准确率。 5. 模型评估:使用测试集对模型进行评估,计算准确率、精确率、召回率等指标。 6. 模型应用:使用训练好的模型对新的验证码进行识别。 下面是一个简单的示例代码,可以作为你的参考: ```python import os import random import numpy as np import tensorflow as tf from PIL import Image # 定义验证码字符集 CHAR_SET = ['0', '1', '2', '3', '4', '5', '6', '7', '8', '9', 'A', 'B', 'C', 'D', 'E', 'F', 'G', 'H', 'I', 'J', 'K', 'L', 'M', 'N', 'O', 'P', 'Q', 'R', 'S', 'T', 'U', 'V', 'W', 'X', 'Y', 'Z'] # 定义验证码图片大小 IMAGE_WIDTH = 150 IMAGE_HEIGHT = 60 # 定义训练集和测试集大小 TRAIN_SIZE = 10000 TEST_SIZE = 1000 # 定义模型参数 LEARNING_RATE = 0.001 BATCH_SIZE = 128 EPOCHS = 10 # 生成验证码图片 def generate_captcha(char_set=CHAR_SET, width=IMAGE_WIDTH, height=IMAGE_HEIGHT): # 随机选择4个字符作为验证码 captcha_text = ''.join(random.sample(char_set, 4)) # 创建画布,绘制验证码 image = Image.new('RGB', (width, height), (255, 255, 255)) font_path = os.path.join(os.path.dirname(__file__), 'captcha.ttf') font = ImageFont.truetype(font_path, 40) draw = ImageDraw.Draw(image) draw.text((10, 10), captcha_text, fill=(0, 0, 0), font=font) # 对验证码进行扭曲、干扰等处理 image = image.filter(ImageFilter.SMOOTH) image = image.filter(ImageFilter.SHARPEN) image = image.filter(ImageFilter.EDGE_ENHANCE_MORE) image = image.filter(ImageFilter.EMBOSS) image = image.filter(ImageFilter.CONTOUR) # 转换为灰度图像 image = image.convert('L') # 转换为numpy数组 captcha_array = np.array(image) return captcha_text, captcha_array # 生成训练集和测试集 def generate_dataset(size): X = np.zeros([size, IMAGE_HEIGHT, IMAGE_WIDTH]) Y = np.zeros([size, len(CHAR_SET)]) for i in range(size): captcha_text, captcha_array = generate_captcha() X[i] = captcha_array Y[i, CHAR_SET.index(captcha_text[0])] = 1 Y[i, CHAR_SET.index(captcha_text[1])] = 1 Y[i, CHAR_SET.index(captcha_text[2])] = 1 Y[i, CHAR_SET.index(captcha_text[3])] = 1 return X, Y # 构建模型 def build_model(): input_layer = tf.keras.layers.Input(shape=(IMAGE_HEIGHT, IMAGE_WIDTH)) x = tf.keras.layers.Reshape(target_shape=(IMAGE_HEIGHT, IMAGE_WIDTH, 1))(input_layer) x = tf.keras.layers.Conv2D(filters=32, kernel_size=(3, 3), activation='relu')(x) x = tf.keras.layers.MaxPooling2D(pool_size=(2, 2))(x) x = tf.keras.layers.Conv2D(filters=64, kernel_size=(3, 3), activation='relu')(x) x = tf.keras.layers.MaxPooling2D(pool_size=(2, 2))(x) x = tf.keras.layers.Flatten()(x) x = tf.keras.layers.Dense(units=1024, activation='relu')(x) output_layer = tf.keras.layers.Dense(units=len(CHAR_SET), activation='softmax')(x) model = tf.keras.models.Model(inputs=input_layer, outputs=output_layer) model.compile(optimizer=tf.keras.optimizers.Adam(learning_rate=LEARNING_RATE), loss=tf.keras.losses.CategoricalCrossentropy(), metrics=['accuracy']) return model # 训练模型 def train_model(model, X_train, Y_train, X_test, Y_test): model.fit(x=X_train, y=Y_train, batch_size=BATCH_SIZE, epochs=EPOCHS, validation_data=(X_test, Y_test)) # 测试模型 def test_model(model, X_test, Y_test): loss, accuracy = model.evaluate(x=X_test, y=Y_test) print('Test Loss:', loss) print('Test Accuracy:', accuracy) # 生成训练集和测试集 X_train, Y_train = generate_dataset(TRAIN_SIZE) X_test, Y_test = generate_dataset(TEST_SIZE) # 构建模型 model = build_model() # 训练模型 train_model(model, X_train, Y_train, X_test, Y_test) # 测试模型 test_model(model, X_test, Y_test) ``` 该代码使用 TensorFlow 2.x 实现了一个简单的卷积神经网络模型,用于识别包含4个字符的验证码图片。需要注意的是,由于验证码图片的生成方式可能不同,需要根据实际情况对特征提取和模型构建进行调整。
评论 30
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值