nekohtml的简单使用

最新推荐文章于 2022-06-01 11:22:36 发布

iteye_12007

最新推荐文章于 2022-06-01 11:22:36 发布

阅读量353

点赞数

分类专栏： HTML 文章标签： HTML XML Google 脚本工作

本文链接：https://blog.csdn.net/iteye_12007/article/details/81967531

版权

HTML 专栏收录该内容

14 篇文章 0 订阅

订阅专栏

     做了一段时间的网页解析的工作，有了些体会，写出来和大家分享。
     现在流行的HTML解析工具主要有HTML Parser和nekohtml，我就不细介绍他们了，有兴趣的话可以自己google。个人比较喜欢用nekohtml+xerces，xerces实际上也是一个XML的解析包，nekohtml建筑在其之上，两者搭配后可将网页解析成一颗DOM树，这样我们对于网页的操作就转化为对这棵树的操作了，而这正是它和HTML Parser的不同之处，也是我喜欢它的原因。
     我们对网页的操作主要通过org.w3c.dom中提供的接口（nekohtml+xerces提供这些接口的实现），熟悉XML解析的朋友对这个包一定不会陌生。这个包中用的比较多的接口有：Node、Document、Element、Text等。Node是DOM树中所有节点根接口，它的子接口有Document、ProcessingInstruction、Element、Comment、Text等，具体的继承层次请参考java doc。正如这些接口的名字说显示的，它们对应于DOM树中相应的元素，这里我就不细说了，下面我们通过一个例子来说明它们的使用方法。
     从网页中抽取文本是一项很平常的工作，HTML Parser中提供了一个TextExtractingVisitor来实现这一点，但nekohtml没有现成这样的类，我们自己写一个也不难：

import java.io.BufferedReader;
import java.io.FileReader;

import org.cyberneko.html.parsers.DOMParser;
import org.w3c.dom.Document;
import org.w3c.dom.Element;
import org.w3c.dom.Node;
import org.w3c.dom.NodeList;
import org.xml.sax.InputSource;

public class Demo {
public static String TextExtractor(Node root){
   //若是文本节点的话，直接返回
   if (root.getNodeType() == Node.TEXT_NODE) {
    return root.getNodeValue().trim();
   }
   if(root.getNodeType() == Node.ELEMENT_NODE) {
    Element elmt = (Element) root;
    //抛弃脚本
    if (elmt.getTagName().equals("STYLE")
      || elmt.getTagName().equals("SCRIPT"))
     return "";

    NodeList children = elmt.getChildNodes();
    StringBuilder text = new StringBuilder();
    for (int i = 0; i < children.getLength(); i++) {
     text.append(TextExtractor(children.item(i)));
    }
    return text.toString();
   }
   //对其它类型的节点，返回空值
   return "";
}
public static void main(String[] args) throws Exception{
   //生成html parser
   DOMParser parser = new DOMParser();
   //设置网页的默认编码
   parser.setProperty(
     "http://cyberneko.org/html/properties/default-encoding",
     "gb18030");
   //input file
   BufferedReader in = new BufferedReader(new FileReader("input.htm"));
   parser.parse(new InputSource(in));
   Document doc = parser.getDocument();
   //获得body节点，以此为根，计算其文本内容
   Node body = doc.getElementsByTagName("BODY").item(0);
   System.out.println(TextExtractor(body));
}
}

除了提供DOM接口外，nekohtml还有一些其他功能，如格式化网页文本、确保网页格式良好（well-formed）等，具体可参见nekohtml的文档。

iteye_12007

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
nekohtml的简单使用

做了一段时间的网页解析的工作，有了些体会，写出来和大家分享。现在流行的HTML解析工具主要有HTML Parser和nekohtml，我就不细介绍他们了，有兴趣的话可以自己google。个人比较喜欢用nekohtml+xerces，xerces实际上也是一个XML的解析包，nekohtml建筑在其之上，两者搭配后可将网页解析成一颗DOM树，这样我们对于网页的操作就转化...
复制链接

扫一扫

专栏目录