使用POI转换word doc文件

转载 2015年07月07日 10:21:59

使用POI转换word doc文件

目录

1       转换为Html文件

2       转换为Xml文件

3       转换为Text文件

 

       在POI中还存在有针对于word doc文件进行格式转换的功能。我们可以将word的内容转换为对应的Html文件,也可以把它转换为底层用来描述doc文档的xml文件,还可以把它转换为底层用来描述doc文档的xml格式的text文件。这些格式转换都是通过AbstractWordConverter特定的子类来完成的。

 

1       转换为Html文件

       将doc文档转换为对应的Html文档是通过WordToHtmlConverter类进行的。它会尽量的利用Html的方式来呈现原文档的样式。示例代码:

Java代码  收藏代码
  1. /** 
  2.  * Word转换为Html 
  3.  * @throws Exception 
  4.  */  
  5. @Test  
  6. public void testWordToHtml() throws Exception {  
  7.    InputStream is = new FileInputStream("D:\\test.doc");  
  8.    HWPFDocument wordDocument = new HWPFDocument(is);  
  9.    WordToHtmlConverter converter = new WordToHtmlConverter(DocumentBuilderFactory.newInstance().newDocumentBuilder().newDocument());  
  10.    //对HWPFDocument进行转换  
  11.    converter.processDocument(wordDocument);  
  12.      Writer writer = new FileWriter(new File("D:\\converter.html"));  
  13.     Transformer transformer = TransformerFactory.newInstance().newTransformer();  
  14.     transformer.setOutputProperty( OutputKeys.ENCODING, "utf-8" );  
  15.     //是否添加空格  
  16.      transformer.setOutputProperty( OutputKeys.INDENT, "yes" );  
  17.     transformer.setOutputProperty( OutputKeys.METHOD, "html" );  
  18.     transformer.transform(  
  19.                 new DOMSource(converter.getDocument() ),  
  20.                 new StreamResult( writer ) );  
  21. }  

2       转换为Xml文件

       将doc文档转换为对应的Xml文件是通过WordToFoConverter类进行的。它可以把doc文档转换为底层用来描述doc文档的Xml文档。示例代码:

Java代码  收藏代码
  1.    /** 
  2.     * Word转Fo 
  3.     * @throws Exception 
  4.     */  
  5.    @Test  
  6.    public void testWordToFo() throws Exception {  
  7.       InputStream is = new FileInputStream("D:\\test.doc");  
  8.       HWPFDocument wordDocument = new HWPFDocument(is);  
  9.       WordToFoConverter converter = new WordToFoConverter(DocumentBuilderFactory.newInstance().newDocumentBuilder().newDocument());  
  10.       //对HWPFDocument进行转换  
  11.       converter.processDocument(wordDocument);  
  12.         Writer writer = new FileWriter(new File("D:\\converter.xml"));  
  13.        Transformer transformer = TransformerFactory.newInstance().newTransformer();  
  14.        transformer.setOutputProperty( OutputKeys.ENCODING, "utf-8" );  
  15.        //是否添加空格  
  16.         transformer.setOutputProperty( OutputKeys.INDENT, "yes" );  
  17. //     transformer.setOutputProperty( OutputKeys.METHOD, "html" );  
  18.        transformer.transform(  
  19.                    new DOMSource(converter.getDocument() ),  
  20.                    new StreamResult( writer ) );  
  21.    }  
  22.    

 

3       转换为Text文件

       将doc文档转换为text文档是通过WordToTextConverter来进行的。它可以把doc文档转换为底层用于描述doc文档的Xml格式的text文档。示例代码:

Java代码  收藏代码
  1. /** 
  2.  * Word转换为Text 
  3.  * @throws Exception 
  4.  */  
  5. @Test  
  6. public void testWordToText() throws Exception {  
  7.    InputStream is = new FileInputStream("D:\\test.doc");  
  8.    HWPFDocument wordDocument = new HWPFDocument(is);  
  9.    WordToTextConverter converter = new WordToTextConverter(DocumentBuilderFactory.newInstance().newDocumentBuilder().newDocument());  
  10.    //对HWPFDocument进行转换  
  11.    converter.processDocument(wordDocument);  
  12.      Writer writer = new FileWriter(new File("D:\\converter.txt"));  
  13.     Transformer transformer = TransformerFactory.newInstance().newTransformer();  
  14.     transformer.setOutputProperty( OutputKeys.ENCODING, "utf-8" );  
  15.     //是否添加空格  
  16.      transformer.setOutputProperty( OutputKeys.INDENT, "yes" );  
  17.     transformer.setOutputProperty( OutputKeys.METHOD, "text" );  
  18.     transformer.transform(  
  19.                 new DOMSource(converter.getDocument() ),  
  20.                 new StreamResult( writer ) );  
  21. }  

 

 

相关文章推荐

使用POI读写word doc文件

Apache poi的hwpf模块是专门用来对word doc文件进行读写操作的。在hwpf里面我们使用HWPFDocument来表示一个word doc文档。在HWPFDocument里面有这么几个...

使用POI读写word doc文件

使用POI读写word doc文件 目录 1     读word doc文件 1.1     通过WordExtractor读文件 1.2     通...

使用office的word进行doc(x)->pdf文件的转换

1.适用场景在java环境下也有其他转pdf的工具,但是实际效果很一般,遇到复杂一点的格式就乱了。但是调用word来转效果好多了,目前为止没遇到格式不理想的。 当然局限性就是本机要是windows系统...

使用Java的POI工具进行Word的DOC文档转为HTML页面技术简介

使用Java的POI工具进行Word的DOC文档转为HTML页面技术简介
  • wacky
  • wacky
  • 2017-03-18 16:16
  • 333

java使用poi读取doc和docx文件

这几天在学习java io流的东西,有一个网友看到博客后问了一个问题,就是说他的doc文档为什么用我所说的方法死活就是乱码。 我一开始以为是他方法问题,结果自己试了之后发现和他的结果一样也是...

使用POI将office(doc/docx/ppt/pptx/xls/xlsx)文件转html格式(附带源码)

妹子我写代码很辛苦/(ㄒoㄒ)/~~ ,转载请标明出处哦~        本项目使用poi将office文档转为html文件,使用java代码实现,移植到android处理速度很慢,请慎用      ...

Java 使用jacob ppt文件转pptx,doc转docx;word 转html、pdf等

Java 使用jacob ppt文件转pptx,doc转docx
内容举报
返回顶部
收藏助手
不良信息举报
您举报文章:深度学习:神经网络中的前向传播和反向传播算法推导
举报原因:
原因补充:

(最多只允许输入30个字)