python爬虫框架-scrapy简介

最新推荐文章于 2023-06-26 14:35:45 发布

虾米吃螃蟹

最新推荐文章于 2023-06-26 14:35:45 发布

阅读量188

点赞数

分类专栏： python

python 专栏收录该内容

3 篇文章 0 订阅

订阅专栏

本博客内容来自于拓海的博客
1、框架简介
这里写图片描述
组件
Engine: 引擎负责控制数据流在系统中所有组件中流动，并在相应动作发生时触发事件。
Scheduler: 调度器从引擎接受Request并将他们入队，以便之后引擎请求他们时提供给引擎。
Downloader: 下载器负责获取页面数据并提供给引擎，而后提供给Spider。
Spiders: Spider是Scrapy用户编写的用于分析Response并提取Item或提取更多需要下载的URL的类。每个Spider负责处理特定网站。
Item Pipeline: 负责处理被Spider提取出来的Item。典型的功能有清洗、验证及持久化操作。
Downloader middlewares: 下载器中间件是在Engine及Downloader之间的特定钩子(specific hooks)，处理Downloader传递给Engine的Response。其提供了一个简便的机制，通过插入自定义代码来扩展Scrapy功能。
Spider middlewares: 是在Engine及Spider之间的特定钩子(specific hook)，处理Spider的输入(Response)和输出(Items及Requests)。其提供了一个简便的机制，通过插入自定义代码来扩展Scrapy功能。

数据流
Scrapy中的数据流由执行引擎控制，其过程如下:
Engine从Spider获取第一个需要爬取URL(s)。
Engine用Scheduler调度Requests，并向Scheduler请求下一个要爬取的URL。
Scheduler返回下一个要爬取的URL给Engine。
Engine将URL通过Downloader middlewares转发给Downloader。
一旦页面下载完毕，下载器生成一个该页面的Response，并将其通过Downloader middlewares发送给Engine。
引擎从Downloader中接收到Response并通过Spider middlewares发送给Spider处理。
Spider处理Response并返回爬取到的Item及新的Request给Engine。
Engine将爬取到的Item给Item Pipeline，然后将Request给Scheduler。
从第一步开始重复这个流程，直到Scheduler中没有更多的URLs。

虾米吃螃蟹

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
python爬虫框架-scrapy简介

本博客内容来自于拓海的博客 1、框架简介组件 Engine: 引擎负责控制数据流在系统中所有组件中流动，并在相应动作发生时触发事件。 Scheduler: 调度器从引擎接受Request并将他们入队，以便之后引擎请求他们时提供给引擎。 Downloader: 下载器负责获取页面数据并提供给引擎，而后提供给Spider。 Spiders: Spider是Scrapy用户编写的用于分...
复制链接

扫一扫

专栏目录