python解析mht文件_实现MHT文件格式的解析和内容抽取

本文介绍了一个Python自定义的MHT文件解析器,用于从MHT格式的资料中提取内容并建立索引。通过解码HTML部分,使用nekoHtml库提取文本,实现了对MHT文件的解析和内容抽取。目前支持提取标题和正文,并计划进一步完善编码检测和其他内容的提取。
摘要由CSDN通过智能技术生成

由于我们的业务系统中有大量的MHT格式的资料,需要对其建立索引,搜索很久了一直没有找到相关解析的类库,只好自己动手丰衣足食了。已实现内容的提取以及和lucene的整合,稍后会完善编码检测及其他内容的提取,做一个完整的parser出来。

文本内容提取:  首先提取html部分的内容,解码之后使用nekoHtml提取文本内容;

public class MhtDocHandler extends HtmDocHandler {

private DOMFragmentParser parser = new DOMFragmentParser();

public Document getDocument(InputStream is) throws DocumentHandlerException {

DocumentFragment node = new HTMLDocumentImpl().createDocumentFragment();

try {

String mhts = IOUtils.toString(is);

int a1 = mhts.indexOf("

int a2 = mhts.indexOf("");

String html = mhts.substring(a1, a2 + 8);

//在mht中文本按照QuotedPrintable格式编码

html = decodeQuotedPrintable(html, "UTF-8");

StringReader r = new StringReader(html);

parser.parse(new InputSour

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值