简单的网络爬虫实现（Jsoup使用）

最新推荐文章于 2022-10-30 15:35:45 发布

HFUT_qianyang

最新推荐文章于 2022-10-30 15:35:45 发布

阅读量4.6k

点赞数 4

分类专栏： java 基于Java的网络爬虫原理与技术实战文章标签： java jquery

本文链接：https://blog.csdn.net/qy20115549/article/details/52201991

版权

java 同时被 2 个专栏收录

99 篇文章 5 订阅

订阅专栏

基于Java的网络爬虫原理与技术实战

37 篇文章 164 订阅

订阅专栏

jsoup 是一款Java 的HTML解析器，可直接解析某个URL地址、HTML文本内容。它提供了一套非常省力的API，可通过DOM，CSS以及类似于jQuery的操作方法来取出和操作数据。

下面是我写的一个案例欢迎大家参考：

package crawlerTest;
import java.io.IOException;
import org.jsoup.Jsoup;
import org.jsoup.nodes.Document;
import org.jsoup.nodes.Element;
import org.jsoup.select.Elements;


public class JsoupTest {
    public static void main(String[] args) throws IOException {
        /*
         * 解析一个字符串
        */
        String html = "<html><head><title>First parse</title></head>"
                + "<body><p>Parsed HTML into a doc.</p></body></html>";
        Document doc = Jsoup.parse(html);
        System.out.println(doc);
        /*
         * 解析url
        */
        String url="http://www.tripadvisor.com/SearchForums?q=airbnb&x=18&y=10&pid=34633&s=+";
        Document doc1=Jsoup.connect(url).userAgent("bbb").timeout(50000).get();
        Elements ele=doc1.select("table[class=forumsearchresults]").select("tr[class~=firstpostrow?]");
        for (Element elem:ele) {
            String _id=elem.attr("id");
            String _url="http://www.tripadvisor.com"+elem.select("td[onclick~=setPID?]").select("a").
                    attr("href");
            String _content=elem.select("td[onclick~=setPID?]").select("a").text();
            System.out.println(_id+"===="+_url+"===="+_content);
        }
    }
}