调用ocr解析图片内容

package net.wocai.tools.spider;


import java.io.BufferedReader;    
import java.io.File;    
import java.io.FileInputStream;    
import java.io.InputStreamReader;    
import java.util.ArrayList;    
import java.util.List;    
import org.jdesktop.swingx.util.OS;    
    
public class OCR {    
    private final String LANG_OPTION = "-l";  //英文字母小写l,并非数字1    
    private final String EOL = System.getProperty("line.separator");    
    private String tessPath = "D://orc//Tesseract-OCR";    
    //private String tessPath = new File("tesseract").getAbsolutePath();    
        
    public String recognizeText(File imageFile)throws Exception{    
      //  File tempImage = ImageIoHelper.createImage(imageFile,imageFormat);    
        File outputFile = new File(imageFile.getParentFile(),"output"); 
       // String s=imageFile.getParentFile().getParentFile().toString();
        //System.out.println(imageFile.getParentFile().getParentFile());
        StringBuffer strB = new StringBuffer();    
        List cmd = new ArrayList();    
        if(OS.isWindowsXP()){    
            cmd.add(tessPath+"//tesseract");    
        }else if(OS.isLinux()){    
            cmd.add("tesseract");    
        }else{    
            cmd.add(tessPath+"//tesseract");    
        }    
        cmd.add("");    
        cmd.add(outputFile.getName());    
        cmd.add(LANG_OPTION);    
       // cmd.add("chi_sim");  
        cmd.add("eng");    
//            cmd.add("E:");
//            cmd.add(LANG_OPTION); 
//            cmd.add("tesseract"+" "+imageFile+" "+"output");
//            cmd.add("eng");
        ProcessBuilder pb = new ProcessBuilder();    
       pb.directory(imageFile.getParentFile());    
            
        cmd.set(1, imageFile.getName());    
        pb.command(cmd);    
        pb.redirectErrorStream(true);    
            
        Process process = pb.start();    
        //tesseract.exe 1.jpg 1 -l chi_sim    
        int w = process.waitFor();    
            
        //删除临时正在工作文件    
      //  tempImage.delete();    
            
        if(w==0){    
            BufferedReader in = new BufferedReader(new InputStreamReader(new FileInputStream(outputFile.getAbsolutePath()+".txt"),"UTF-8"));    
                
            String str;    
            while((str = in.readLine())!=null){    
                strB.append(str).append(EOL);    
            }    
            in.close();    
        }else{    
            String msg;    
            switch(w){    
                case 1:    
                    msg = "Errors accessing files.There may be spaces in your image's filename.";    
                    break;    
                case 29:    
                    msg = "Cannot recongnize the image or its selected region.";    
                    break;    
                case 31:    
                    msg = "Unsupported image format.";    
                    break;    
                default:    
                    msg = "Errors occurred.";    
            }    
            //tempImage.delete();    
            throw new RuntimeException(msg);    
        }    
        new File(outputFile.getAbsolutePath()+".txt").delete();  
       // System.out.println(strB.toString());
        return strB.toString();    
    }    
}    
  • 2
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
微软提供了一种名为OCR的技术,可以实现文字识别,并且可以通过VB编程语言调用该技术。 在使用VB调用微软的OCR之前,我们需要先进行一些准备工作。首先,我们需要安装并配置OCR引擎。微软提供了一个OCR引擎叫做Microsoft OCR Library,可以在官方网站上进行下载和安装。安装完成后,我们还需要将OCR引擎添加到我们的VB项目中。 在VB中调用OCR引擎的过程中,我们需要使用到一些API来实现与OCR引擎的交互。VB中有一些现成的API可以使用,我们可以通过调用这些API来实现与OCR引擎的通信。通过这些API,我们可以将要识别的文本传递给OCR引擎,并获取到识别结果。 在调用OCR引擎时,我们将文本传递给OCR引擎后,它将对文本进行分析和识别,然后将识别结果返回给我们。我们可以将识别结果用于各种用途,比如进行文本分析、信息提取等。 在使用VB调用微软的OCR时,我们需要注意一些事项。首先,我们需要确保我们的VB项目与OCR引擎的版本兼容。如果VB项目使用的是较旧的版本,可能需要升级到与OCR引擎兼容的版本。此外,我们还需要确保我们的VB项目中包含了正确的引用和依赖项,以便能够正确调用OCR引擎的API。 综上所述,通过VB调用微软的OCR引擎,我们可以实现文字识别的功能。这个过程需要我们安装和配置OCR引擎,使用VB的API与OCR引擎进行通信,以及处理返回的识别结果。通过这种方式,我们可以将OCR技术应用到我们的VB项目中,实现更强大的功能。

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值