java爬虫框架webmagic学习一

web magic简介

爬虫框架webmagic
在这里插入图片描述
webmagic的设计目标是尽量的模块化,并体现爬虫的功能特点,这部分提供非常简单、灵活的API,在基本不改吧开发模式的情况下,编写一个爬虫。
Webmagic的结构分为Downloader、PageProcessor、Scheduler、Pipeline四大组件,并由Spider将他们彼此组织起来,这四大组件对应爬虫声明周期中的下载、处理、管理、和持久化等功能。而Spider则将这几个组件组织起来,让他们可以互相交互,流程化的执行,可以认为Spider是一个大容器,他也是WebMagic逻辑的核心。
WebMagic的四个组件
1.Downloader
Downloader负责从互联网上下载页面,以便后续处理。WebMagic默认使用了Apache HttpClient作为下载工具。

2.PageProcessor
PageProcessor负责解析页面,抽取有用信息,以及发现新的链接。WebMagic使用Jsoup作为HTML解析工具,并基于其开发了解析XPath的工具Xsoup。

在这四个组件中,PageProcessor对于每个站点每个页面都不一样,是需要使用者定制的部分。

3.Scheduler
Scheduler负责管理待抓取的URL,以及一些去重的工作。WebMagic默认提供了JDK的内存队列来管理URL,并用集合来进行去重。也支持使用Redis进行分布式管理。

除非项目有一些特殊的分布式需求,否则无需自己定制Scheduler。

4.Pipeline
Pipeline负责抽取结果的处理,包括计算、持久化到文件、数据库等。WebMagic默认提供了“输出到控制台”和“保存到文件”两种结果处理方案。

Pipeline定义了结果保存的方式,如果你要保存到指定数据库,则需要编写对应的Pipeline。对于一类需求一般只需编写一个Pipeline。

web magic第一个demo

创建一个maven项目,引入webmagic的maven坐标,pom文件如下

<?xml version="1.0" encoding="UTF-8"?>
<project xmlns="http://maven.apache.org/POM/4.0.0"
         xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"
         xsi:schemaLocation="http://maven.apache.org/POM/4.0.0 http://maven.apache.org/xsd/maven-4.0.0.xsd">
    <modelVersion>4.0.0</modelVersion>

    <groupId>com.xz.webmagic</groupId>
    <artifactId>webmagic</artifactId>
    <version>1.0-SNAPSHOT</version>

    <dependencies>
        <dependency>
            <groupId>us.codecraft</groupId>
            <artifactId>webmagic-core</artifactId>
            <version>0.7.3</version>
        </dependency>
        <dependency>
            <groupId>us.codecraft</groupId>
            <artifactId>webmagic-extension</artifactId>
            <version>0.7.3</version>
        </dependency>
    </dependencies>
</project>

创建一个测试类,实现PageProcessor接口,PageProcessor也就是页面解释器,实现接口的process和getSite方法,process处理逻辑,page是对页面的封装,getSite是返回的站点,site是对当前的站点配置内容,比如可以设置超时时间,重试次数等,代码如下

package com.xz.webmagic;

import us.codecraft.webmagic.Page;
import us.codecraft.webmagic.Site;
import us.codecraft.webmagic.Spider;
import us.codecraft.webmagic.processor.PageProcessor;

/**
 * 爬取类
 * PageProcessor页面解释器
 */
public class MyProcessor implements PageProcessor  {
    /**
     * 解析页面的方法
     * @param page
     */
    @Override
    public void process(Page page) {
        //打印页面内容
        System.out.println(page.getHtml().toString());
    }

    /**
     * 返回当前站点的信息
     * 对当前站点的一个封装,可以设置超时时间
     * @return
     */
    @Override
    public Site getSite() {
        //设置失眠时间,100毫秒去抓取页面,是因为某些网站设置了反爬取时间,设置时间大一点可以避开设置。
        return Site.me().setSleepTime(100).setRetryTimes(3);
    }

    public static void main(String[] args) {
        Spider.create( new MyProcessor()).addUrl("https://www.csdn.net/").run();
    }
}

执行main方法测试

控制台会把我们爬取的页面信息html打印出来,证明测试成功:
在这里插入图片描述


-END-

创作不易,如果你喜欢我的分享,想结交更多的朋友,关注微信公众号
java学长
学习更多java技术干货,提升职场技术水平!

  • 0
    点赞
  • 1
    收藏
    觉得还不错? 一键收藏
  • 打赏
    打赏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

IT悍将阿瑞

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值