tika提取html,TIKA提取HTML文档

TIKA提取HTML文档

下面给出的是该程序用于从HTML文档提取内容和元数据。

importjava.io.File;importjava.io.FileInputStream;importjava.io.IOException;importorg.apache.tika.exception.TikaException;importorg.apache.tika.metadata.Metadata;importorg.apache.tika.parser.ParseContext;importorg.apache.tika.parser.html.HtmlParser;importorg.apache.tika.sax.BodyContentHandler;importorg.xml.sax.SAXException;publicclassHtmlParse{publicstaticvoidmain(finalString[]args)throwsIOException,SAXException,TikaException{//detecting the file typeBodyContentHandlerhandler=newBodyContentHandler();Metadatametadata=newMetadata();FileInputStreaminputstream=newFileInputStream(newFile("example.htmll"));ParseContextpcontext=newParseContext();//Html parserHtmlParserhtmlparser=newHtmlParser();htmlparser.parse(inputstream,handler,metadata,pcontext);System.out.println("Contents of the document:"+handler.toString());System.out.println("Metadata of the document:");String[]metadataNames=metadata.names();for(Stringname:metadataNames){System.out.println(name+": "+metadata.get(name));}}}

保存上述代码保存为HtmlParse.java,并通过使用下面的命令从命令提示编译:

javacHtmlParse.java

javaHtmlParse

下面给出的是 example.htmll 文档的快照。

46b16bb30b4869f95a16dc2162b4bd3a.png

HTML文档有以下属性:

ac5be64881b49dff1986112dd3896b64.png

执行上述程序后,将得到下面的输出。

输出:

Contents of the document:

Name Salary age

Ramesh Raman 50000 20

Shabbir Hussein 70000 25

Umesh Raman 50000 30

Somesh 50000 35

Metadata of the document:

title: HTML Table Header

Content-Encoding: windows-1252

Content-Type: text/html; charset=windows-1252

dc:title: HTML Table Header

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值