前言
这两天在看相关于模拟登录的案例,不可避免的遇到了一些验证码相关的问题,在此之前一直使用的是将验证码下载到本地,然后人工肉眼识别的方式。但是效果可想而知,精确度倒是还可以,然而却变得不是很智能了。于是今天来学习一下如何自动识别验证码。
环境
我的实验环境为:
- Python3.6
- Pycharm2016.2 Professional
- Tesseract-OCR-3.0
- Windows 10 64位
在开始之前确保安装了tesseract引擎,然后是pytesseract这个第三方库。
如果没有安装其实也是可以使用的,那就是借助Python调用系统命令的方式来实现将验证码图片中的内容读入到文本文件,在通过代码读取文本文件得到验证码内容。 但是pytesseract使得这样的一个过程更加简便,所以没有安装的话还是建议安装一下。
pip install pytesseract
读取图片的时候需要PIL库的支持,没有安装的话还是建议先安装一下,否则程序无法进行下去的。