用htmlparser提取table信息

最新推荐文章于 2021-04-08 16:44:29 发布

bg090721

最新推荐文章于 2021-04-08 16:44:29 发布

阅读量404

点赞数

分类专栏： htmlparser java 文章标签： htmlparser CssSelectorNodeFilter AndFilter NotFilter HasChildFilter

本文链接：https://blog.csdn.net/bg090721/article/details/84217153

版权

java 同时被 2 个专栏收录

9 篇文章 0 订阅

订阅专栏

htmlparser

2 篇文章 0 订阅

订阅专栏

htmlparser1.6
提取tr似乎有些问题，直接用css selector提取的tr冗余，tr里面还有tr。
所以这里多做了些处理。请看代码。

  public static Map<String,String> parseList(String url) {
    Map<String,String> rlt=new LinkedHashMap<String,String>();
    NodeFilter filter=new CssSelectorNodeFilter (".className tr");
    filter = new AndFilter(filter, new NotFilter(new HasChildFilter(new CssSelectorNodeFilter ("tr"))));
    Parser parser;
    try {
      parser = new Parser(url);
      NodeList list = parser.extractAllNodesThatMatch(filter);
      for(int i=0;i<list.size();i++){
        Node tr=list.elementAt(i);
        parser = new Parser(tr.toHtml());
        NodeList tds = parser.extractAllNodesThatMatch(new CssSelectorNodeFilter ("td"));
        String key=tds.elementAt(0).toPlainTextString();
        String value=tds.elementAt(1).toPlainTextString();
        rlt.put(key, value);
      }
    } catch (ParserException e) {
      e.printStackTrace();
    }
    return rlt;
  }

考虑一下