java实现图片文字识别的两种方法

最新推荐文章于 2023-07-31 17:30:00 发布

zengwenhe1987

最新推荐文章于 2023-07-31 17:30:00 发布

阅读量5.3k

点赞数 3

分类专栏： java

原文链接：https://www.cnblogs.com/uip001/p/10795621.html

版权

java 专栏收录该内容

69 篇文章 1 订阅

订阅专栏

一、使用tesseract-ocr

　　1. https://github.com/tesseract-ocr/tesseract/wiki上下载安装包安装和简体中文训练文件

　　　　window64位安装包：tesseract-ocr-w64-setup-v4.1.0.20190314.exe

　　　　简体中文训练文件：chi_sim.traineddata 约40M

　　2.　将训练文件chi_sim.traineddata放入安装目录下的tessdata目录中

　　3. 配置环境变量，在path变量中加入tesseract安装目录，例如C:\Program Files\Tesseract-OCR

　　4.　添加系统环境变量TESSDATA_PREFIX，值为训练文件的目录，例如C:\Program Files\Tesseract-OCR\tessdata

　　5.　使用java调用命令行执行转换，命令格式例如：F:\pic> tesseract 6.png 66 -l chi_sim 即：在F:\pic目录下使用tesseract命令利用chi_sim训练文件把6.png文件转换成66.txt文件

二、使用tess4j

　　1. 使用maven下载所需jar包：

复制代码

<dependency>
<groupId>net.java.dev.jna</groupId>
<artifactId>jna</artifactId>
<version>4.1.0</version>
</dependency>

<dependency>
<groupId>net.sourceforge.tess4j</groupId>
<artifactId>tess4j</artifactId>
<version>3.4.0</version>
<exclusions>
<exclusion>
<groupId>com.sun.jna</groupId>
<artifactId>jna</artifactId>
</exclusion>
</exclusions>
</dependency>

复制代码

　　2.下载简体中文训练文件：chi_sim.traineddata

　　3.使用如下代码调用

复制代码

        //加载待读取图片
        File imageFile = new File("F://pic.png");
        //创建tess对象
        ITesseract instance = new Tesseract();
        //设置训练文件目录
        instance.setDatapath("F://tessdata");
        //设置训练语言
        instance.setLanguage("chi_sim");
        //执行转换
        String result = instance.doOCR(imageFile);

复制代码

zengwenhe1987

关注

3
点赞
踩
32

收藏

觉得还不错? 一键收藏
0
评论
java实现图片文字识别的两种方法

一、使用tesseract-ocr　　1. https://github.com/tesseract-ocr/tesseract/wiki上下载安装包安装和简体中文训练文件　　　　window64位安装包：tesseract-ocr-w64-setup-v4.1.0.20190314.exe　　　　简体中文训练文件：chi_sim.traineddata 约40M　　2.　将训练文件chi_sim.traineddata放入安装目录下的tessdata目录中　　3. 配置环境...
复制链接

扫一扫

专栏目录