python训练识别库_jTessBoxEditor训练识别库

最新推荐文章于 2023-07-30 22:38:35 发布

weixin_39606638

最新推荐文章于 2023-07-30 22:38:35 发布

阅读量461

点赞数

文章标签： python训练识别库

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_39606638/article/details/111457265

版权

本文介绍了如何使用jtessboxeditor和tesseract进行样本图片训练，生成自定义的语言库，以提高验证码识别率。通过灰度化处理、合并样本图片、生成box文件、修改box文件、创建训练文件、字符集文件、shape文件，以及进行特征文件的生成和合并，最终得到fontyp.traineddata文件，用于提升特定验证码的识别准确性。

摘要由CSDN通过智能技术生成

1、背景

前文已经简要介绍tesseract ocr引擎的安装及基本使用，其中提到使用-l eng参数来限定语言库，可以提高识别准确率及识别效率。

本文将针对某个网站的验证码进行样本训练，形成自己的语言库，来提高验证码识别率。

2、准备工具

总结一下：

1、工具2 java虚拟机Ver 1.8.0_91 64位版本 (oracle官网)

2、工具1 jtessboxeditorVer 1.5版本 (jtessboxeditor官网)，运行界面如下：

3、使用实例

1)、准备样本图片

手动刷新某网站验证码，手动或者写程序，保存了101个验证码样本文件，分别命名成：1.png，2.png，……，101.png。

该验证码有几个特点：a、定长4位，b、都是数字，c、有背景干扰，但比较简单，d、字体为红色。

为了提高识别率，首先做了一个工作就是灰度化处理，并全部转换成tif文件，分别命名成：1.tif，2.tif，……，101.tif，统一存放在d:\python\lnypcg下。

2)、合并样本图片

打开jtessboxeditor，点击Tools->Merge Tiff ，按住shift键选择前文提到的101个tif文件，并把生成的tif合并到新目录d:\python\lnypcg\new下，命名为langyp.fontyp.exp0.tif。

注意：langyp 是本人定义的语言名称，fontyp是本人定义的字体名称，后续都会用到，你可以修改成你喜欢的名字。

3)、生成box文件

执行命令生成langyp.fontyp.exp0.box文件

tesseract langyp.fontyp.exp0.tif langyp.fontyp.exp0 -l eng -psm 7 batch.nochop makebox

D:\python\lnypcg\new>tesseract langyp.fontyp.exp0.tif langyp.fontyp.exp0 -l eng -psm 7 batch.nochop makebox

Tesseract Open Source OCR Engine v3.02 with Leptonica

Page 1 of 101

Page 2 of 101

Page 3 of 101

……

Page 101 of 101

D:\python\lnypcg\new>dir

驱动器 D 中的卷没有标签。

卷的序列号是 36D9-CDC7

D:\python\lnypcg\new 的目录

2016-06-03 14:37

2016-06-03 14:37

2016-06-03 14:30 6,327 langyp.fontyp.exp0.box

2016-06-03 13:07 126,056 langyp.fontyp.exp0.tif

2 个文件 132,383 字节

2 个目录 24,869,994,496 可用字节

4)、修改box文件

切换到jTessBoxEditor工具的Box Editor页，点击open，打开前面的tiff文件langyp.fontyp.exp0.tif，工具会自动加载对应的box文件。

检查box数据，如下图所示，数字8被误认成字母H，手工修改H成8，并保存。

点击下图红色框的按钮，逐个核对tif文件的box数据，全部检查结束并保存。

5)、生成font_properties

执行echo命令生成font_properties。

echo fontyp 0 0 0 0 0 >font_properties

也可以手工新建一个名为font_properties的文本文件(注意该文件没有扩展名)，内容为字体名fontyp，后面带5个0，分别代表字体的粗体、斜体等属性，这里全部是0

最低0.47元/天解锁文章

weixin_39606638

关注

0
点赞
踩
2

收藏

觉得还不错? 一键收藏
0
评论
python训练识别库_jTessBoxEditor训练识别库

1、背景前文已经简要介绍tesseract ocr引擎的安装及基本使用，其中提到使用-l eng参数来限定语言库，可以提高识别准确率及识别效率。本文将针对某个网站的验证码进行样本训练，形成自己的语言库，来提高验证码识别率。2、准备工具总结一下：1、工具2 java虚拟机Ver 1.8.0_91 64位版本 (oracle官网)2、工具1 jtessboxeditorVer 1.5版本 (jtess...
复制链接

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。