Java调用tess4j完成 OCR 文字识别

daqinzl

已于 2024-04-25 16:03:42 修改

阅读量793

点赞数 4

文章标签： java ocr tess4j Tesseract

于 2024-04-25 15:52:28 首次发布

本文链接：https://blog.csdn.net/daqinzl/article/details/138191569

版权

1，新建 maven 工程

2，引入依赖
<dependency>
   <groupId>net.sourceforge.tess4j</groupId>
   <artifactId>tess4j</artifactId>
   <version>5.11.0</version>
</dependency>

3，安装 tesseract-ocr

下载地址https://digi.bib.uni-mannheim.de/tesseract/tesseract-ocr-w64-setup-5.3.3.20231005.exe

其他版本可以查看 https://digi.bib.uni-mannheim.de/tesseract/

安装过程中一直点下一步，建议取消语言包选项，后面手动下载

可能需要安装visual c++ 2015-2019 redistributable或最新版visual c++ 2015-2022 redistributable

4，下载语言包
https://digi.bib.uni-mannheim.de/tesseract/tessdata_fast/

下载enm.traineddata和chi_sim.traineddata，复制粘贴到C:\Program Files\Tesseract-OCR\tessdata

5，调用 Tesseract API 完成文本识别

import java.io.File;

import net.sourceforge.tess4j.Tesseract;

public class Tess4jDemo {

   public static void main(String[] args) {
       // 创建实例
       Tesseract instance = new Tesseract();

       // 设置语言包路径
       instance.setDatapath("C:\\Program Files\\Tesseract-OCR\\tessdata");

       // 设置语言
       instance.setLanguage("chi_sim");

       // 设置文本文件
       File file = new File("C:\\Users\\user1\\Desktop\\截图.PNG");

       try {
           // 文本识别
           String result = instance.doOCR(file);
           System.out.println(result);
       } catch (Exception e) {
           e.printStackTrace();
       }
   }