没看错!一行python代码就可以帮您获取图片中的文字信息

107 篇文章 11 订阅
56 篇文章 4 订阅
文章介绍了如何使用Python的pytesseract库结合Tesseract-OCR引擎进行图片中的文字识别。在处理中文字符时需设置lang=chi_sim,并确保安装了Pillow和正确配置了Tesseract-OCR。然而,对于复杂的校验码,Tesseract-OCR的识别效果不佳。
摘要由CSDN通过智能技术生成

最近工作中有需求需要用python对图片中的文字进行识别,调研了一下,选择了tesseract,

目前在github上有50.5k个star!python可以调用,安装也十分方便,pip install pytesseract 即可。如果没有Pillow 包,还需要执行pip install Pillow。

核心代码

读取图片中文字信息的核心api如下:

from PIL import Image
import pytesseract
captcha_text = pytesseract.image_to_string(Image.open("d:/tmp/img4.png"), lang='chi_sim')
print(captcha_text)

上面这段代码中需要解释的是如果图片中有中文字符则需要添加参数lang='chi_sim',并在安装的过程中添加识别中文的字符库,后面会讲到!

运行代码遇到的问题

直接运行上面的代码,会遇到下面的问题

raise TesseractNotFoundError()
pytesseract.pytesseract.TesseractNotFoundError: tesseract is not installed or it's not in your PATH. See README file for more information.

我们来分析一下这个错误!错误提示tesseract没有安装,但是我们明明已经执行了pip install pytesseract,那么问题会出在哪里呢?

我们需要先了解一下pytesseract,它是一款用于光学字符识别(OCR)的python工具,即从图片中识别出和“读取”其中嵌入的文字,底层使用的是Google的Tesseract-OCR 引擎,pytesseract只是对Tesseract-OCR的一层封装!看到这里我们就能够理解 ,运行python代码

pytesseract.image_to_string() 报错的原因了!因为我的PC上并没有安装Tesseract-OCR,pytesseract是无法调用Tesseract-OCR的api为我们干活的!

安装Tesseract-OC

Tesseract-OCR windows 版本的下载链接如下:

https://github.com/UB-Mannheim/tesseract/wiki

下载成功后,只需默认安装,在安装的过程中,如果想对其他国家语言文字识别可以选择相对应的语言包,如下图

安装成功后配置路径 C:\Program Files\Tesseract-OCR 到环境变量中即可。

再次运行,正常执行!大家可以自己做一张文字图片的截图查看效果。

复杂的登录校验码无法识别

另外我测试了Tesseract-OCR对复杂校验码的识别情况,如下图:

 

结论是:复杂的校验码仍然无法识别。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

测试开发Kevin

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值