利用Lucene和 XPDF 来处理pdf文件

/*
 * 利用Lucene和 XPDF 来处理pdf文件
 * */
package pdfbox;


import java.io.File;
import java.io.IOException;


public class Pdf2Test {
//PDF文件名
private File pdffile;

//转换器的存放位置,默认为E:\\xpdf下
private String CONVERTOR_STORED_PATH = "E:\\xpdf";

//转换器的名称, 默认为pdftotext
private String CONVERTOR_NAME = "pdftotext";

//构造函数,参数为pdf文件的路径
public Pdf2Test(String pdffile) throws IOException {
this(new File(pdffile));
}


//构造函数,参数为PDF文件对象
public Pdf2Test(File file){
this.pdffile = pdffile;
}

//将PDF转化为文本文档
public void toTextFile() throws IOException{
toTextFile(pdffile, true);
}

//将PDF转化为文本文档,参数为目标文件的路径,默认使用PDF文件的布局
public void toTextFile(String targetfile) throws IOException{
toTextFile(new File(targetfile), true);
}

//将PDF转化为文本文,参数一维目标文件的路径
//参数2位true,则表示使用PDF文件中的布局
public void toTestFile(String targetfile, boolean isLayout) throws IOException{
toTextFile(new File(targetfile), isLayout);
}


//将PDF转化为文本文档,参数为目标文件
public void toTextFile(File targetfile) throws IOException{
toTextFile(targetfile, true);

}

//将PDF转换为文档,参数一维目标文件
//参数二位true,表示使用了PDF文件中的布局
public void toTextFile(File targetfile, boolean isLayout) throws IOException{
String[] cmd = getCmd(targetfile, isLayout);
Process p = Runtime.getRuntime().exec(cmd);
}

//获取转换器
public String getCONVERTOR_STORED_PATH(){
return CONVERTOR_STORED_PATH;
}


//设置PDF转换器的路径
public void setCONVERTOR_STORED_PATH(String path){
if(!path.trim().endsWith("\\"))
path = path.trim() + "\\";
this.CONVERTOR_STORED_PATH = path;
}

//解析命令行参数
private String[] getCmd(File targetfile, boolean isLayout){
//命令字符
String command = CONVERTOR_STORED_PATH + CONVERTOR_NAME;

//PDF文件的绝对路劲
String source_absolutePath = pdffile.getAbsolutePath();

//输出文本文件的绝对路径
String target_absolutePath = targetfile.getAbsolutePath();

//保持原来的layout
String layout = "-layout";

//设置编码方式
String encoding = "-enc";
String character = "GBK";

//设置不打印任何消息和错误
String mistake = "-q";


//页面之间不加入分页
String nopagebrk = "-nopgbrk";

//如果isLayout为false,则设置不保持原来的layout
if(!isLayout)
layout = "";
return new String[]{
command, layout, encoding, character, mistake, nopagebrk, source_absolutePath, target_absolutePath
};

}



public static void main(String[] args) {
// TODO Auto-generated method stub
try{
//参数输入PDF文件的存放位置
Pdf2Test p2t = new Pdf2Test("E:\\Lucene项目\\C语言代码.pdf");

//设定转换器的位置
p2t.setCONVERTOR_STORED_PATH("E:\\xpdftest\\xpdf");

//设置文本文件存放的位置
p2t.toTextFile("E:\\Lucene项目\\XPDF\\");
}catch(Exception e){
e.printStackTrace();
}
}


}
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

杨鑫newlfe

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值