PDdocument.

import org.pdfbox.pdmodel.PDdocument.
import org.pdfbox.pdfparser.PDFParser;
import java.io.
* ;
import org.pdfbox.util.PDFTextStripper;
import java.util.Date;
/**
 * <p>Title: pdf extraction</p>
 * <p>Description: email:chris@matrix.org.cn</p>
 * <p>Copyright: Matrix Copyright (c) 2003</p>
 * <p>Company: Matrix.org.cn</p>
 * @author chris
 * @version 1.0,who use this example pls remain the declare
 
*/


public   class  PdfExtracter {

public PdfExtracter(){
  }

public String GetTextFromPdf(String filename) throws Exception
  
{
  String temp
=null;
  PDdocument.nbsppdfdocument.
null;
  FileInputStream 
is=new FileInputStream(filename);
  PDFParser parser 
= new PDFParser( is );
  parser.parse();
  pdfdocument.nbsp
= parser.getPDdocument.);
  ByteArrayOutputStream 
out = new ByteArrayOutputStream();
  OutputStreamWriter writer 
= new OutputStreamWriter( out );
  PDFTextStripper stripper 
= new PDFTextStripper();
  stripper.writeText(pdfdocument.getdocument.), writer );
  writer.close();
  
byte[] contents = out.toByteArray();

  String ts
=new String(contents);
  System.
out.println("the string length is"+contents.length+"/n");
  
return ts;
}

public static void main(String args[])
{
PdfExtracter pf
=new PdfExtracter();
PDdocument.nbsppdfdocument.nbsp
= null;

try{
String ts
=pf.GetTextFromPdf("c://a.pdf");
System.
out.println(ts);
}

catch(Exception e)
  
{
  e.printStackTrace();
  }

}


}


同时CSHARP如下
引用一些类

PDDocument doc = PDDocument.load("4.pdf");
   //doc.getDocument();
   PDFTextStripper pdfStripper = new PDFTextStripper();

   
   PDFTextStripper stripper = new PDFTextStripper();
   stripper.getText(doc);
   doc.close();


最新版本省去了一下数据流的操作
参考: http://pdfhome.hope.com.cn/
  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值