基于scrapy-redis两种形式的分布式爬虫

最新推荐文章于 2024-06-23 16:01:36 发布

Python 学习者

最新推荐文章于 2024-06-23 16:01:36 发布

阅读量262

点赞数

文章标签： python

原文链接：https://www.jianshu.com/u/8f2987e2f9fb

版权

1.scrapy框架是否可以自己实现分布式？

不可以。原因有二。

其一：因为多台机器上部署的scrapy会各自拥有各自的调度器，这样就使得多台机器无法分配start_urls列表中的url。（多台机器无法共享同一个调度器）
其二：多台机器爬取到的数据无法通过同一个管道对数据进行统一的数据持久出存储。（多台机器无法共享同一个管道）

2.基于scrapy-redis组件的分布式爬虫

scrapy-redis组件中为我们封装好了可以被多台机器共享的调度器和管道，我们可以直接使用并实现分布式数据爬取。
实现方式：

基于该组件的RedisSpider类
基于该组件的RedisCrawlSpider类

3.分布式实现流程：上述两种不同方式的分布式实现流程是统一的

下载scrapy-redis组件：pip install scrapy-redis
redis配置文件的配置：

注释该行：bind 127.0.0.1，表示可以让其他ip访问redis
将yes该为no：protected-mode no，表示可以让其他ip操作redis

修改爬虫文件中的相关代码：

将爬虫类的父类修改成基于RedisSpider或者RedisCrawlSpider。注意：如果原始爬虫文件是基于Spider的，则应该将父类修改成RedisSpider，如果原始爬虫文件是基于CrawlSpider的，则应该将其父类修改成RedisCrawlSpider。
注释或者删除start_urls列表，切加入redis_key属性，属性值为scrpy-redis组件中调度器队列的名称

在配置文件中进行相关配置，开启使用scrapy-redis组件中封装好的管道

  ITEM_PIPELINES = {
      'scrapy_redis.pipelines.RedisPipeline': 400
  }

在配置文件中进行相关配置，开启使用scrapy-redis组件中封装好的调度器

'''
遇到问题没人解答？小编创建了一个Python学习交流QQ群：778463939
寻找有志同道合的小伙伴，互帮互助,群里还有不错的视频学习教程和PDF电子书！
'''
  # 使用scrapy-redis组件的去重队列
  DUPEFILTER_CLASS = "scrapy_redis.dupefilter.RFPDupeFilter"

  # 使用scrapy-redis组件自己的调度器
  SCHEDULER = "scrapy_redis.scheduler.Scheduler"

  # 是否允许暂停
  SCHEDULER_PERSIST = True

在配置文件中进行爬虫程序链接redis的配置：

  REDIS_HOST = 'redis服务的ip地址'
  REDIS_PORT = 6379
  REDIS_ENCODING = ‘utf-8’
  REDIS_PARAMS = {‘password’:’123456’}

开启redis服务器：redis-server 配置文件
开启redis客户端：redis-cli
运行爬虫文件：scrapy runspider SpiderFile
向调度器队列中扔入一个起始url（在redis客户端中操作）：lpush redis_key属性值起始url

Python 学习者

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
基于scrapy-redis两种形式的分布式爬虫

1.scrapy框架是否可以自己实现分布式？不可以。原因有二。其一：因为多台机器上部署的scrapy会各自拥有各自的调度器，这样就使得多台机器无法分配start_urls列表中的url。（多台机器无法共享同一个调度器）其二：多台机器爬取到的数据无法通过同一个管道对数据进行统一的数据持久出存储。（多台机器无法共享同一个管道）2.基于scrapy-redis组件的分布式爬虫scrapy-redis组件中为我们封装好了可以被多台机器共享的调度器和管道，我们可以直接使用并实现分布式数据爬取。
复制链接

扫一扫