关闭

jsoup 爬虫

250人阅读 评论(0) 收藏 举报
分类:
MVN: 
  <dependency>
            <!-- jsoup HTML parser library @ http://jsoup.org/ -->
            <groupId>org.jsoup</groupId>
            <artifactId>jsoup</artifactId>
            <version>1.9.2</version>
        </dependency>
        <dependency>
            <groupId>org.json</groupId>
            <artifactId>json</artifactId>
            <version>20160810</version>
        </dependency>


程序:

{
            Map<String, String> map = new HashMap<>();

            System.out.println("urlLink:" + urlLink);
            Document document = Jsoup.connect(urlLink).timeout(10000).get();

//            System.out.println(" 获取资源结束,开始解析。 document: "+document);
            if (document != null) {
                System.out.println("解析开始");
                Elements elements = document.select(".ad-title");
                for (Element e1 : elements) {
                    String link = e1.attr("href").trim();
                    links.add(link);
                }

                Elements es2 = document.select(".salary");
                for (Element e3 : es2) {
                    String sa1 = e3.text().trim();
                    if (sa1.length() < 5) {
                        sa1 = "3000-4000";
                    }
                    String sa2 = sa1.substring(0, 4);
                    salarys.add(sa2);

                }

                Elements es3 = document.select(".table-view-cap");
                for (Element e4 : es3) {
                    String a1 = e4.text().trim();
                    String[] a2 = a1.split("/");
                    String c1 = a2[0].trim();
                    String a3 = a2[1].trim();

                    areaName.add(a3);
                    contacts.add(c1);
                }

                for (int i = 0; i < links.size(); i++) {

                    getFullDetails(links.get(i), salarys.get(i), areaName.get(i), contacts.get(i));

                }


            } else {
                System.out.println("document is null");
            }


        }


0
0
查看评论
发表评论
* 以上用户言论只代表其个人观点,不代表CSDN网站的观点或立场

网络爬虫技术Jsoup——爬到一切你想要的

概述:本周五,接到一个任务,要使用爬虫技术来获取某点评网站里面关于健身场馆的数据,之前从未接触过爬虫技术,于是就从网上搜了一点学习资料,本篇文章就记录爬虫技术Jsoup技术,爬虫技术听名称很牛叉,其实...
  • ccg_201216323
  • ccg_201216323
  • 2016-12-11 23:19
  • 10609

网络采集器Demo:Jsoup+Java多线程实现[爬虫](上)

ailab-mltk:http://blog.csdn.net/qdhy199148/article/details/49403585 里面最简单,但是很常用的一个部分,就是网络爬虫,从网页上获取文本...
  • qdhy199148
  • qdhy199148
  • 2015-11-01 00:01
  • 2711

基于Jsoup实现的简单爬虫

Jsoup 概念 jsoup 是一款Java 的HTML解析器,可直接解析某个URL地址、HTML文本内容。它提供了一套非常省力的API,可通过DOM,CSS以及类似于jQuery的操作方法来取出...
  • WuZuoDingFeng
  • WuZuoDingFeng
  • 2016-12-09 15:19
  • 1690

使用 Jsoup 爬虫解析 html 新闻的实例

本文 转自:http://blog.csdn.net/junbin_fan/article/details/24814407 一、目标主页 实例中进行解析的的目标主页是宁夏大学新闻网,在主方法中...
  • xuanjiewu
  • xuanjiewu
  • 2016-06-08 12:19
  • 805

jsoup网络爬虫

  • 2017-12-18 10:02
  • 2.26MB
  • 下载

jsoup爬虫案例

  • 2017-09-18 23:57
  • 327KB
  • 下载

Jsoup网络爬虫

  • 2017-03-15 19:54
  • 2.26MB
  • 下载

Jsoup-网络爬虫项目

  • 4天前 18:31
  • 30KB
  • 下载

爬虫插件jsoup

  • 2017-12-10 21:13
  • 350KB
  • 下载

java jsoup爬虫代码

  • 2017-12-04 14:36
  • 2.37MB
  • 下载
    个人资料
    • 访问:87845次
    • 积分:2361
    • 等级:
    • 排名:第18207名
    • 原创:83篇
    • 转载:19篇
    • 译文:0篇
    • 评论:21条