python - crawler 之 scrapy多线程爬虫

最新推荐文章于 2024-07-14 19:57:32 发布

开码牛

最新推荐文章于 2024-07-14 19:57:32 发布

阅读量950

点赞数

分类专栏： python 文章标签： python scrapy python爬虫爬虫

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/helunqu2017/article/details/113786743

版权

python 专栏收录该内容

119 篇文章 29 订阅

订阅专栏

本文详细介绍了Scrapy爬虫框架，包括官方文档、学习资源、安装配置步骤。Scrapy是一个强大的Python爬虫框架，利用Twisted进行异步网络通信。其主要组件包括引擎、调度器、下载器、爬虫、ItemPipeline和中间件。Scrapy通过这些组件协同工作，实现高效的数据抓取和处理。同时，文章提供了Anaconda和pip两种安装方式，以及实战案例链接，帮助读者快速上手。

摘要由CSDN通过智能技术生成

目录

1.scrapy教程资料

2scrapy安装配置

3.介绍scrapy框架

1.scrapy教程资料

官方文档

中文版：http://scrapy-chs.readthedocs.io/zh_CN/0.24/intro/tutorial.html
英文版：https://doc.scrapy.org/en/latest/topics/request-response.html

训练资料

scrapy学习篇：https://www.cnblogs.com/cnkai/category/1061919.html
scrapy实战篇：https://www.cnblogs.com/cnkai/category/1062011.html
Redis + Scrapy 搭建分布式爬虫
https://blog.csdn.net/tichimi3375/article/details/82353597#t0

2scrapy安装配置

Anaconda集成环境安装scrapy-推荐
cmd进入控制台，conda install scrapy
pip安装scrapy
pip install scrapy ，该方法安装问题较多

3.介绍scrapy框架

Scrapy 使用了Twisted异步网络库来处理网络通讯。整体架构大致如下

基本组件

(1)引擎（Engine）

引擎负责控制数据流在系统中所有组件中流动，并在相应动作发生时触发事件。

(2)调度器（Scheduler）

调度器从引擎接受request并将他们入队，以便之后引擎请求他们时提供给引擎。

(3)下载器(Downloader)

下载器负责获取页面数据并提供给引擎，而后提供给spider。

(4)爬虫（Spiders）

Spider是Scrapy用户编写用于分析response并提取item(即获取到的item)或额外跟进的URL的类。每个spider负责处理一个特定(或一些)网站。

(5)管道（Item Pipeline）

Item Pipeline负责处理被spider提取出来的item。典型的处理有清理、验证及持久化(例如存取到数据库中)。

(6)下载器中间件（Downloader middlewares）

下载器中间件是在引擎及下载器之间的特定钩子(specific hook)，如下图，处理Downloader传递给引擎的response。其提供了一个简便的机制，通过插入自定义代码来扩展Scrapy功能。

(7)Spider中间件（Spider middlewares）

Spider中间件是在引擎及Spider之间的特定钩子(specific hook)，如下图，处理spider的输入(response)和输出(items及requests)。其提供了一个简便的机制，通过插入自定义代码来扩展Scrapy功能。

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。