python3 Scrapy简介

最新推荐文章于 2021-07-07 11:03:30 发布

jeikerxiao

最新推荐文章于 2021-07-07 11:03:30 发布

阅读量1k

点赞数 2

分类专栏： Python 文章标签： python 网络爬虫 scrapy

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/jeikerxiao/article/details/73649466

版权

Scrapy是一个基于Twisted的Python爬虫框架，用于爬取网站数据和提取结构化信息。它包括Scrapy Engine、Scheduler、Downloader、Spiders、Item Pipeline、Downloader Middlewares、Spider Middlewares和Scheduler Middlewares等组件。Scrapy的工作流程涉及引擎获取URL、调度、下载网页、蜘蛛解析响应生成Item、Item通过Pipeline处理和请求的反复调度。整个框架提供了灵活的数据处理和中间件扩展能力。

摘要由CSDN通过智能技术生成

什么是Scrapy

Scrapy 是一套基于Twisted的异步处理框架，是纯python实现的爬虫框架。

Scrapy 是一个为了爬取网站数据，提取结构性数据而编写的应用框架。可以应用在包括数据挖掘，信息处理或存储历史数据等一系列的程序中。

其最初是为了网络抓取所设计的，也可以应用在获取API所返回的数据或者通用的网络爬虫。

用户只需要定制开发几个模块就可以轻松的实现一个爬虫，用来抓取网页内容或者各种图片。

Scrapy组件说明

1.Scrapy Engine（Scrapy引擎）

Scrapy Engine是用来控制整个系统的数据处理流程，并进行事务处理的触发。

2.Scheduler（调度）

Scheduler从Scrapy Engine接受请求并排序列入队列，并在Scrapy Engine发出请求后返还给他们。

3.Downloader（下载器）

Downloader的主要职责是抓取网页并将网页内容返还给Spiders。

4.Spiders（蜘蛛）

Spider是有Scrapy用户自己定义用来解析网页并抓取制定URL返回的内容的类，每个spider都能处理一个域名或一组域名。

换句话说就是用来定义特定网站的抓取和解析规则。

Spider的整个抓取流程（周期）是这样的：

首先获取第一个URL的初始请求，当请求返回后调取一个回调函数。第一个请求是通过调用start_re

最低0.47元/天解锁文章

关注

2
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。