Scrapy框架解析

最新推荐文章于 2022-06-05 13:23:21 发布

qq_26515913

最新推荐文章于 2022-06-05 13:23:21 发布

阅读量173

点赞数

本文链接：https://blog.csdn.net/qq_26515913/article/details/100662649

版权

Scrapy框架解析

Scrapy框架图

1、引擎（Scrapy Engine）

引擎负责控制数据流在系统中所有组件中流动，并在相应动作发生时触发事件。详细内容查看下面的数据流(Data Flow)部分。

2、调度器(Scheduler)

调度器从引擎接受request并将它们入队，以便之后引擎请求它们时提供给引擎

3、下载器（Downloader）

下载器负责获取页面数据兵器同给引擎，而后提供给spider

4、爬虫（Spiders）

spider是scrapy用户编写用于分析response并提供给item或额外跟进的URL类。每个spider负责处理一个特定（或一些）网站。

5、管道（Item Pipeline）

item Pipeline负责处理被spider提取出来的item。典型的处理有清理、验证及持久化（如存取到数据库中）

6、下载器中间件（Downloader middlewares）

下载器中间件是在引擎及下载器之间的特定钩子(specific hook)，处理Downloader传递给引擎的response。其提供了一个简便的机制，通过插入自定义代码来扩展Scrapy功能。

7、爬虫中间件(Spider middlewares)

Spider中间件是在引擎及Spider之间的特定钩子(specific hook)，处理spider的输入(response)和输出(items及requests)。其提供了一个简便的机制，通过插入自定义代码来扩展Scrapy功能。

8、数据流（Data flow）

Scrapy中的数据流由执行引擎控制，其过程如下:

1、引擎打开一个网站(open a domain)，找到处理该网站的Spider并向该spider请求第一个要爬取的URL(s)。
2、引擎从Spider中获取到第一个要爬取的URL并在调度器(Scheduler)以Request调度。
3、引擎向调度器请求下一个要爬取的URL。
4、调度器返回下一个要爬取的URL给引擎，引擎将URL通过下载中间件(请求(request)方向)转发给下载器(Downloader)。
5、一旦页面下载完毕，下载器生成一个该页面的Response，并将其通过下载中间件(返回(response)方向)发送给引擎。
6、引擎从下载器中接收到Response并通过Spider中间件(输入方向)发送给Spider处理。
7、Spider处理Response并返回爬取到的Item及(跟进的)新的Request给引擎。
8、引擎将(Spider返回的)爬取到的Item给Item Pipeline，将(Spider返回的)Request给调度器。
9、(从第二步)重复直到调度器中没有更多地request，引擎关闭该网站。

qq_26515913

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
Scrapy框架解析

Scrapy框架解析1、引擎（Scrapy Engine）引擎负责控制数据流在系统中所有组件中流动，并在相应动作发生时触发事件。详细内容查看下面的数据流(Data Flow)部分。2、调度器(Scheduler)调度器从引擎接受request并将它们入队，以便之后引擎请求它们时提供给引擎3、下载器（Downloader）下载器负责获取页面数据兵器同给引擎，而后提供给spider4...
复制链接

扫一扫