将.doc或.docx文件转换为text

     首先,介绍一下poi。

     Apache POI是 Apache 软件 基金会的开放源码函式库,POI提供API给Java程序对Microsoft Office格式档案读和写的功能。
     POI结构:
      HSSF - 提供读写 Microsoft Excel 格式档案的功能。
      XSSF - 提供读写 Microsoft Excel OOXML 格式档案的功能。
      HWPF - 提供读写 Microsoft Word 格式档案的功能。
      HSLF - 提供读写Microsoft PowerPoint格式档案的功能。
     HDGF - 提供读写 Microsoft Visio 格式档案的功能。

 

     将.doc或.docx文件转换为text的方法如下:

import java.io.File;
import java.io.FileInputStream;
import java.io.FileNotFoundException;
import java.io.IOException;

import org.apache.poi.POIXMLDocument;

import org.apache.poi.hwpf.extractor.WordExtractor;
import org.apache.poi.xwpf.extractor.XWPFWordExtractor;

class WordToText{
 public static String wordToText(String filepath)throws Exception{
  String returnstr="";
  try{
   File file=new File(filepath);
   FileInputStream fis=new FileInputStream(file);
   if(filepath.endsWith(".doc")){
    WordExtractor doc=new WordExtractor(fis);
    returnstr=doc.getText();//提取.doc正文文本
   }else if(filepath.endsWith(".docx")){
    XWPFWordExtractor docx=new XWPFWordExtractor(POIXMLDocument.openPackage(filepath));
    returnstr=docx.getText();
   }
  }catch(FileNotFoundException e){
   e.printStackTrace();
  }catch(IOException e){
   e.printStackTrace();
  }catch(Exception e){
   e.printStackTrace();
  }
  return returnstr;
 }
}

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值