利用jTessBoxEditor工具进行Tesseract3.02.02样本训练，提高验证码识别率

最新推荐文章于 2024-05-22 09:32:27 发布

youer0713

最新推荐文章于 2024-05-22 09:32:27 发布

阅读量372

点赞数

分类专栏： tesseract

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/TX713/article/details/80487791

版权

本文介绍了如何使用jTessBoxEditor工具对特定网站的验证码进行样本训练，以创建自定义语言库，从而提高验证码识别率。通过详细步骤，包括准备样本图片、生成box文件、训练文件等，最终实现对验证码的高识别率。

摘要由CSDN通过智能技术生成

1、背景

前文已经简要介绍tesseract ocr引擎的安装及基本使用，其中提到使用-l eng参数来限定语言库，可以提高识别准确率及识别效率。

本文将针对某个网站的验证码进行样本训练，形成自己的语言库，来提高验证码识别率。

2、准备工具

tesseract样本训练有一个官方流程说明，https://github.com/tesseract-ocr/tesseract/wiki/TrainingTesseract#run-tesseract-for-training，不过都是英文的，个人认为这个地址适合于查找细节问题，全程看E文对大众还是有一定的困难。

具体的方法有两种：1-利用三方工具，2-完全命令行操作，三方工具主要在https://github.com/tesseract-ocr/tesseract/wiki/AddOns下载，本文将用到jTessBoxEditor这个工具，我们先给他下载到本地。

需要特别说明，这个工具是基于java虚拟机运行的，所以我们还要下载并安装一个java虚拟机，下载地址：http://download.oracle.com/otn-pub/java/jdk/8u91-b14/jdk-8u91-windows-x64.exe?AuthParam=1463733597_1161f2d895aa7606ed260b43b83d5f86。

总结一下：

1、工具2 java虚拟机 Ver 1.8.0_91 64位版本（oracle官网）

2、工具1 jtessboxeditor Ver 1.5版本（jtessboxeditor官网），运行界面如下：

3、使用实例

1)、准备样本图片

手动刷新某网站验证码，手动或者写程序，保存了101个验证码样本文件，分别命名成：1.png，2.png，……，101.png。

该验证码有几个特点：a、定长4位，b、都是数字，c、有背景干扰，但比较简单，d、字体为红色。

为了提高识别率，首先做了一个工作就是灰度化处理，并全部转换成tif文件，分别命名成：1.tif，2.tif，……，101.tif，统一存放在d:\python\lnypcg下。

2)、合并样本图片

打开jtessboxeditor，点击Tools->Merge Tiff ，按住shift键选择前文提到的101个tif文件，并把生成的tif合并到新目录d:\python\lnypcg\new下，命名为langyp.fontyp.exp0.tif。

注意：langyp 是本人定义的语言名称，fontyp是本人定义的字体名称，后续都会用到，你可以修改成你喜欢的名字。

3)、生成box文件

执行命令生成langyp.fontyp.exp0.box文件

tesseract langyp.fontyp.exp0.tif langyp.fontyp.exp0 -l eng -psm 7 batch.nochop makebox

最低0.47元/天解锁文章

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
利用jTessBoxEditor工具进行Tesseract3.02.02样本训练，提高验证码识别率

1、背景前文已经简要介绍tesseract ocr引擎的安装及基本使用，其中提到使用-l eng参数来限定语言库，可以提高识别准确率及识别效率。本文将针对某个网站的验证码进行样本训练，形成自己的语言库，来提高验证码识别率。 2、准备工具tesseract样本训练有一个官方流程说明，https://github.com/tesseract-ocr/tesseract/wiki/TrainingTes...
复制链接

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。