分布式爬虫（一）------------------分布式爬虫概述

最新推荐文章于 2024-04-03 20:15:26 发布

weixin_33835103

最新推荐文章于 2024-04-03 20:15:26 发布

阅读量121

点赞数

文章标签：爬虫 python 数据库

原文链接：http://www.cnblogs.com/ruoniao/p/7308048.html

版权

分布式爬虫概述

什么是分布式爬虫：

　　　　　多个爬虫分布在不同的服务器上，通过状态管理器进行统一调度，达到像URL去重等功能的爬虫系统

　　

分布式爬虫的优点

　　1）充分利用多台机器的宽带加速

　　2）充分利用多机器的IP加速爬取速度

Scrapy分布式爬虫原理

　　　　单机Scrapy爬虫架构

　　

分布式爬虫需要改进的Scrapy

　　　　1）requests队列集中管理（在架构图中SCHEDULER中管理）

　　　　2）URL去重集中管理　　

　　　 解决方法：

　　　　　　requests队列存储在单机的内存当中，URL去重原理也是存储在内存当中的Set()集合中，解决这两个问题，

　　　　可以将这个队列和集合存储在数据库中，进行统一的资源管理。

　　　　　　在选择数据库时推荐使用Redis数据库，它是一个基于内存的数据库，将Requests队列和URL集合存储在内存，避免数据落地，提高效率

转载于:https://www.cnblogs.com/ruoniao/p/7308048.html

weixin_33835103

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
分布式爬虫（一）------------------分布式爬虫概述

分布式爬虫概述什么是分布式爬虫：　　　　　多个爬虫分布在不同的服务器上，通过状态管理器进行统一调度，达到像URL去重等功能的爬虫系统　　分布式爬虫的优点　　1）充分利用多台机器的宽带加速　　2）充分利用多机器的IP加速爬取速度Scrapy分布式爬虫原理　　　　单机Scrapy爬虫架构　　分布式爬虫需要改进的Scrapy　　　　1）reques...
复制链接

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。