使用tesseract训练自己的字库简单方法软件一键训练

最新推荐文章于 2024-05-31 13:41:48 发布

FL1623863129

最新推荐文章于 2024-05-31 13:41:48 发布

阅读量4.3k

点赞数 2

分类专栏：深度学习文章标签：深度学习人工智能

本文链接：https://blog.csdn.net/FL1623863129/article/details/123265252

版权

深度学习专栏收录该内容

135 篇文章 18 订阅

订阅专栏

tesseract-ocr训练相信在网上大家都看到过，其使用过程需要敲打很多命令而且容易出错，由于每个人的文章层次不齐，导致有的安装其流程或者方法更本行不通，或者卡壳。为了解决训练困难，FIRC最近开发了一个小工具，可以不用写任何代码，您只需要打开软件导入图片，修改校正文字位置和正确文字即可快速得到自己traineddata文件。具体使用方法如下：

第一步：生成BOX：打开软件

导入图片目录，然后选择自己对应图片格式点击生成BOX即可在软件data文件夹下面生成box文件和tif文件，如果您想使用自己合并好的tif文件可以勾选使用外部tif文件即可，然后选择对应的tif文件后点击生成BOX即可生成对应的box文件。

第二步：校正文字位置和识别结果。我们点击识别校正后会弹出软件，然后我们选择Edit BOX即可开始修正自己文字位置和识别果。

第三步：生成字典，点击后会在data文件下面生成traineddata文件，这就是我们需要的文件，然后我编写python代码测试自己文件

# -*- coding: utf-8 -*-
import cv2
import pytesseract
img=cv2.imread(r'C:\Users\Administrator\Desktop\tesseract-ocr-fast-train\FIRC\bin\Release\images\1.png')
print(img.shape)
text = pytesseract.image_to_string(img,lang='FIRC')
print('ocr result is:',text)

注意lang要和自己traineddata对应起来，而且需要把自己的traineddata文件放在tesseract-ocr安装目录的tessdata文件夹下才可以。具体可以观看视频教程：

tesseract-ocr快速训练助手_哔哩哔哩_bilibili

FL1623863129

关注

2
点赞
踩
8

收藏

觉得还不错? 一键收藏
打赏
2
评论
使用tesseract训练自己的字库简单方法软件一键训练

tesseract-ocr训练相信在网上大家都看到过，其使用过程需要敲打很多命令而且容易出错，由于每个人的文章层次不齐，导致有的安装其流程或者方法更本行不通，或者卡壳。为了解决训练困难，FIRC最近开发了一个小工具，可以不用写任何代码，您只需要打开软件导入图片，修改校正文字位置和正确文字即可快速得到自己traineddata文件。具体使用方法如下：第一步：生成BOX：打开软件导入图片目录，然后选择自己对应图片格式点击生成BOX即可在软件data文件夹下面生成box文件和tif文件，如果您想使
复制链接

扫一扫