scrapy 中间件（Middleware）

最新推荐文章于 2024-08-19 18:25:31 发布

小黑班♪(･ω･)ﾉ

最新推荐文章于 2024-08-19 18:25:31 发布

阅读量775

点赞数

分类专栏： scrapy

本文链接：https://blog.csdn.net/weixin_49487589/article/details/116863838

版权

Scrapy的下载中间件是一个用于全局更改请求和响应的框架，拦截请求和响应，允许修改请求URL、伪装请求头、自动重试等。通过settings.py启用，并在middlewares.py中定义具体功能。

摘要由CSDN通过智能技术生成

中间件（Middleware）

scrapy的中间件是一个重要概念，作用在于批量拦截请求和响应。scrapy中有2种中间件，爬虫中间件（Spider Middleware）和下载中间件（Downloader Middleware）。在这里只记录下载中间件。

下载中间件（Downloader Middleware）

在这里插入图片描述

下载器中间件是一个挂钩Scrapy的请求/响应处理的框架。这是一个轻量级的低级系统，用于全局更改Scrapy的请求和响应。
引用自：https://doc.scrapy.org/en/latest/topics/downloader-middleware.html#scrapy.downloadermiddlewares.DownloaderMiddleware

scrapy自动生成middlewares.py，创建了class MiddleproSpiderMiddleware(爬虫)和class MiddleproDownloaderMiddleware(下载)，在学习测试中删掉了爬虫中间件。

作用

拦截请求和响应的操作

修改请求URL
伪装请求头信息（更换UA、cookie）
自动重试
设置代理（代理操作必须使用中间件才可以实现）

方法

process_request(self, request, spider)
对于请求的中间件实现，拦截所有（正常&异常）的请求。参数request是拦截到的数据，spider是爬虫类实例化的对象。
可以在此类编写、设置请求头信息，即更换UA、cookie等。它与settings.py中设置的区别在于，在此可以为不同的请求定制不同的请求头信息，settings.py作用全局。
虽然可以在此更换cookie，但一般不设置，因为scrapy会自行处理。

	def process_request(self, request, spider):
    	pri

最低0.47元/天解锁文章

小黑班♪(･ω･)ﾉ

关注

0
点赞
踩
2

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录