node.js解析word文档

最近接触了了一个简历管理的项目,需要将简历上传之后解析出里面的字段内容(如姓名、性别、教育经历、工作经历等),存入数据库中。简历的格式都是标准的格式,可参考猎聘下载下来的格式。

毫无疑问,第一个难点就是如何解析word的内容。

到npm去搜了一下相关的包,都不满足我的需求,直到发现了adm-zip这个包,这个包可以解压缩文件。其实word就是一个压缩包,把word解压后,有一个document.xml,里面就存放了word的内容,只需要解析这个xml文件就可以获取到数据了。

const admZip = require('adm-zip');

// 解压word文档
const zip = new admZip('2.docx');
zip.extractAllTo('./output/2', true);

// 提取内容
let contentXml = zip.readAsText("word/document.xml");
//console.log(contentXml);

// 正则匹配文字
let matchWT = contentXml.match(/(<w:t>.*?<\/w:t>)|(<w:t\s.[^>]*?>.*?<\/w:t>)/gi);
matchWT = filter(matchWT);
console.log(matchWT);


/**
 * 去除空白行
 * @param matchWT
 */
function filter(matchWT) {
    let res = [];

    matchWT.forEach(function(wtItem) {
        //如果不是<w:t xml:space="preserve">格式
        if (wtItem !== '<w:t xml:space="preserve"> </w:t>') { {
            wtItem = wtItem.split('>');
            wtItem = wtItem[1].split('<');
            res.push(wtItem[0]);
        }
    });

    return res;
}

这样,我们就可以将简历的内容放入数组中,通过遍历数组就能匹配到对应的字段了。

在解压缩word文档的时候发现这个只能解压缩docx格式的文档,不能解析doc格式的文档。

 

评论 2
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值