java爬虫框架webmagic学习一

最新推荐文章于 2024-08-14 22:12:35 发布

IT悍将阿瑞

最新推荐文章于 2024-08-14 22:12:35 发布

阅读量466

点赞数

分类专栏： webmagic爬虫

本文链接：https://blog.csdn.net/jiarui_mama/article/details/106770376

版权

webmagic爬虫专栏收录该内容

1 篇文章 0 订阅

订阅专栏

web magic简介

爬虫框架webmagic
在这里插入图片描述
webmagic的设计目标是尽量的模块化，并体现爬虫的功能特点，这部分提供非常简单、灵活的API，在基本不改吧开发模式的情况下，编写一个爬虫。
Webmagic的结构分为Downloader、PageProcessor、Scheduler、Pipeline四大组件，并由Spider将他们彼此组织起来，这四大组件对应爬虫声明周期中的下载、处理、管理、和持久化等功能。而Spider则将这几个组件组织起来，让他们可以互相交互，流程化的执行，可以认为Spider是一个大容器，他也是WebMagic逻辑的核心。
WebMagic的四个组件
1.Downloader
Downloader负责从互联网上下载页面，以便后续处理。WebMagic默认使用了Apache HttpClient作为下载工具。

2.PageProcessor
PageProcessor负责解析页面，抽取有用信息，以及发现新的链接。WebMagic使用Jsoup作为HTML解析工具，并基于其开发了解析XPath的工具Xsoup。

在这四个组件中，PageProcessor对于每个站点每个页面都不一样，是需要使用者定制的部分。

3.Scheduler
Scheduler负责管理待抓取的URL，以及一些去重的工作。WebMagic默认提供了JDK的内存队列来管理URL，并用集合来进行去重。也支持使用Redis进行分布式管理。

除非项目有一些特殊的分布式需求，否则无需自己定制Scheduler。

4.Pipeline
Pipeline负责抽取结果的处理，包括计算、持久化到文件、数据库等。WebMagic默认提供了“输出到控制台”和“保存到文件”两种结果处理方案。

Pipeline定义了结果保存的方式，如果你要保存到指定数据库，则需要编写对应的Pipeline。对于一类需求一般只需编写一个Pipeline。

web magic第一个demo

创建一个maven项目，引入webmagic的maven坐标，pom文件如下

<?xml version="1.0" encoding="UTF-8"?>
<project xmlns="http://maven.apache.org/POM/4.0.0"
         xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"
         xsi:schemaLocation="http://maven.apache.org/POM/4.0.0 http://maven.apache.org/xsd/maven-4.0.0.xsd">
    <modelVersion>4.0.0</modelVersion>

    <groupId>com.xz.webmagic</groupId>
    <artifactId>webmagic</artifactId>
    <version>1.0-SNAPSHOT</version>

    <dependencies>
        <dependency>
            <groupId>us.codecraft</groupId>
            <artifactId>webmagic-core</artifactId>
            <version>0.7.3</version>
        </dependency>
        <dependency>
            <groupId>us.codecraft</groupId>
            <artifactId>webmagic-extension</artifactId>
            <version>0.7.3</version>
        </dependency>
    </dependencies>
</project>

创建一个测试类，实现PageProcessor接口，PageProcessor也就是页面解释器，实现接口的process和getSite方法，process处理逻辑，page是对页面的封装，getSite是返回的站点，site是对当前的站点配置内容，比如可以设置超时时间，重试次数等，代码如下

package com.xz.webmagic;

import us.codecraft.webmagic.Page;
import us.codecraft.webmagic.Site;
import us.codecraft.webmagic.Spider;
import us.codecraft.webmagic.processor.PageProcessor;

/**
 * 爬取类
 * PageProcessor页面解释器
 */
public class MyProcessor implements PageProcessor  {
    /**
     * 解析页面的方法
     * @param page
     */
    @Override
    public void process(Page page) {
        //打印页面内容
        System.out.println(page.getHtml().toString());
    }

    /**
     * 返回当前站点的信息
     * 对当前站点的一个封装，可以设置超时时间
     * @return
     */
    @Override
    public Site getSite() {
        //设置失眠时间，100毫秒去抓取页面，是因为某些网站设置了反爬取时间，设置时间大一点可以避开设置。
        return Site.me().setSleepTime(100).setRetryTimes(3);
    }

    public static void main(String[] args) {
        Spider.create( new MyProcessor()).addUrl("https://www.csdn.net/").run();
    }
}