java解析word示例(支持docx、doc,wps格式)

本文介绍如何使用Java的Apache POI库解析Word文档,提供docx、doc和wps文件内容提取的代码示例,包括XWPFDocument、WordExtractor和HWPFDocument的使用。
摘要由CSDN通过智能技术生成

1.导入pom.xml
需要先导入解析插件包

  <!-- POI-word文件处理需要 -->
        <dependency>
            <groupId>org.apache.poi</groupId>
            <artifactId>poi-scratchpad</artifactId>
            <version>4.1.2</version>
        </dependency>

2.代码示例:

package com.common.utils;

import org.apache.poi.hwpf.HWPFDocument;
import org.apache.poi.hwpf.extractor.WordExtractor;
import org.apache.poi.xwpf.usermodel.XWPFDocument;
import org.apache.poi.xwpf.usermodel.XWPFParagraph;
import org.slf4j.Logger;

import java.io.File;
import java.io.FileInputStream;
import java.io.IOException;
import java.io.InputStream;
import java.util.HashMap;
import java.util.List;
import java.util.Map;

/**
 * @ClassName WordAlansis
 * @Description:  java解析word代码示例
 * @Author: mischen
 * @date: 14:57 2022/11/25
 * @Version 1.0
 */
public class WordAlansis {

    public static void main(String[] args) {
        String path ="C:\\Users\\Administrator\\Desktop\\公司资料\\面试\\1.docx";
       // Map<String, String> getContentWps = getContentWps(path);
       // System.out.println(getContentWps);
        Map<String, String> getContentWps = getContentDocx(new File(path));
        System.out.println(getContentWps);
    }

    /**
     * 获取正文文件内容,docx方法
     *
     * @param file
     * @return
     */
    public static Map<String, String> getContentDocx(File file) {
        Map<String, String> map = new HashMap();
        StringBuffer content = new StringBuffer("");
        String result = "0";  // 0表示获取正常,1表示获取异常
        InputStream is = null;
        Logger logger = null;
        try {
            //根据需求入参也可以改为文件路径,对应的输入流部分改为new File(路径)即可
            is = new FileInputStream(file);
            // 2007版本的word
            XWPFDocument xwpf = new XWPFDocument(is);    // 2007版本,仅支持docx文件处理
            List<XWPFParagraph> paragraphs = xwpf.getParagraphs();
            if (paragraphs != null && paragraphs.size() > 0) {
                for (XWPFParagraph paragraph : paragraphs) {
                    if (!paragraph.getParagraphText().startsWith("    ")) {
                        content.append(paragraph.getParagraphText().trim()).append("\r\n");
                    } else {
                        content.append(paragraph.getParagraphText());
                    }
                }
            }
        } catch (Exception e) {
            logger.error("docx解析正文异常:" + e);
            result = "1"; // 出现异常
        } finally {
            if (is != null) {
                try {
                    is.close();
                } catch (IOException e) {
                    logger.error("" + e);
                }
            }
            map.put("result", result);
            map.put("content", String.valueOf(content));
        }
        return map;
    }

    /**
     * 获取正文文件内容,doc方法
     *
     * @param path
     * @return
     */
    public static Map<String, String> getContentDoc(String path) {
        Map<String, String> map = new HashMap();
        StringBuffer content = new StringBuffer("");
        String result = "0";  // 0表示获取正常,1表示获取异常
        InputStream is = null;
        Logger logger = null;
        try {
            is = new FileInputStream(new File(path));
            // 2003版本的word
            WordExtractor extractor = new WordExtractor(is);  // 2003版本 仅doc格式文件可处理,docx文件不可处理
            String[] paragraphText = extractor.getParagraphText();   // 获取段落,段落缩进无法获取,可以在前添加空格填充
            if (paragraphText != null && paragraphText.length > 0) {
                for (String paragraph : paragraphText) {
                    if (!paragraph.startsWith("    ")) {
                        content.append(paragraph.trim()).append("\r\n");
                    } else {
                        content.append(paragraph);
                    }
                }
            }
        } catch (Exception e) {
            logger.error("doc解析正文异常:" + e);
            result = "1"; // 出现异常
        } finally {
            if (is != null) {
                try {
                    is.close();
                } catch (IOException e) {
                    logger.error("" + e);
                }
            }
            map.put("result", result);
            map.put("content", content.toString());
        }
        return map;
    }

    /**
     * 获取正文文件内容,wps方法
     *
     * @param path
     * @return
     */
    public static Map<String, String> getContentWps(String path) {
        Map<String, String> map = new HashMap();
        StringBuffer content = new StringBuffer("");
        String result = "0";  // 0表示获取正常,1表示获取异常
        InputStream is = null;
        Logger logger = null;
        try {
            is = new FileInputStream(new File(path));
            // wps版本word
            HWPFDocument hwpf = new HWPFDocument(is);
            WordExtractor wordExtractor = new WordExtractor(hwpf);
            // 文档文本内容
            String[] paragraphText1 = wordExtractor.getParagraphText();
            if (paragraphText1 != null && paragraphText1.length > 0) {
                for (String paragraph : paragraphText1) {
                    if (!paragraph.startsWith("    ")) {
                        content.append(paragraph.trim()).append("\r\n");
                    } else {
                        content.append(paragraph);
                    }
                }
            }
        } catch (Exception e) {
            logger.error("wps解析正文异常:" + e);
            result = "1"; // 出现异常
        } finally {
            if (is != null) {
                try {
                    is.close();
                } catch (IOException e) {
                    logger.error("" + e);
                }
            }
            map.put("result", result);
            map.put("content", content.toString());
        }
        return map;
    }
}

  • 4
    点赞
  • 23
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
可以使用Apache POI库来实现Java中的docdocx文档的合并。下面是一个示例代码: ```java import java.io.File; import java.io.FileOutputStream; import java.io.IOException; import java.util.ArrayList; import java.util.List; import org.apache.poi.hwpf.HWPFDocument; import org.apache.poi.hwpf.usermodel.Range; import org.apache.poi.hwpf.usermodel.Section; import org.apache.poi.xwpf.usermodel.XWPFDocument; import org.apache.poi.xwpf.usermodel.XWPFParagraph; import org.apache.poi.xwpf.usermodel.XWPFRun; public class MergeDocuments { public static void main(String[] args) throws IOException { // 创建一个空的docx文档 XWPFDocument destDocument = new XWPFDocument(); // docx文件路径列表 List<String> docxFileList = new ArrayList<>(); docxFileList.add("doc1.docx"); docxFileList.add("doc2.docx"); // doc文件路径列表 List<String> docFileList = new ArrayList<>(); docFileList.add("doc3.doc"); // 将所有docx文档的段落复制到目标文档中 for (String docxFilePath : docxFileList) { XWPFDocument docxDocument = new XWPFDocument(new FileInputStream(docxFilePath)); for (XWPFParagraph srcParagraph : docxDocument.getParagraphs()) { XWPFParagraph destParagraph = destDocument.createParagraph(); destParagraph.getCTP().set(srcParagraph.getCTP()); for (XWPFRun srcRun : srcParagraph.getRuns()) { XWPFRun destRun = destParagraph.createRun(); destRun.getCTR().set(srcRun.getCTR()); } } docxDocument.close(); } // 将所有doc文档的段落复制到目标文档中 for (String docFilePath : docFileList) { HWPFDocument docDocument = new HWPFDocument(new FileInputStream(docFilePath)); Range range = docDocument.getRange(); for (int i = 0; i < range.numSections(); i++) { Section section = range.getSection(i); for (int j = 0; j < section.numParagraphs(); j++) { org.apache.poi.hwpf.usermodel.Paragraph docParagraph = section.getParagraph(j); XWPFParagraph destParagraph = destDocument.createParagraph(); destParagraph.createRun().setText(docParagraph.text()); } } docDocument.close(); } // 将目标文档保存到文件中 FileOutputStream out = new FileOutputStream(new File("combinedDocument.docx")); destDocument.write(out); out.close(); destDocument.close(); } } ``` 这个示例代码中,我们首先创建了一个空的docx文档。然后,我们分别读取docxdoc文档,将它们的段落复制到目标文档中。最后,我们将目标文档保存到文件中。 请注意,这个示例代码只是一个简单的示例,你可能需要根据你的具体需求进行修改。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值