网页中正文提取之----joyhtml

天之涯_海之角

于 2013-11-19 19:57:34 发布

阅读量176

点赞数

分类专栏： html 文章标签： java

本文链接：https://blog.csdn.net/wangyanhong88/article/details/84505100

版权

html 专栏收录该内容

7 篇文章 0 订阅

订阅专栏

joyHTML的目的是解析HTML文本当中的链接和正文，利用超链接密度法为主要判断依据的标记窗算法，采用DOM树解析模式。

环境描述：

jdk1.6

joyhtml-0.2.2

提取新闻正文demo代码如下：

import java.net.URL;
import org.cyberneko.html.parsers.DOMParser;
import org.joy.analyzer.html.TextExtractor;
import org.w3c.dom.Document;
import org.xml.sax.InputSource;

public class Test {
	public static void main(String[] args) throws Exception {
		DOMParser parser = new DOMParser();
		String url = "http://finance.people.com.cn/n/2013/1011/c66323-23157265.html";
		parser.parse(new InputSource(new URL(url).openStream()));
		Document doc = parser.getDocument();
		TextExtractor extractor = new TextExtractor(doc);
		String str = extractor.extract();
		System.out.println(str);

	}
}

依赖的lib参见附件