java启动scrapy爬虫,爬虫入门之Scrapy 框架基础功能(九)详解

最新推荐文章于 2024-06-27 09:50:35 发布

weixin_32243075

最新推荐文章于 2024-06-27 09:50:35 发布

阅读量647

点赞数

文章标签： java启动scrapy爬虫

本文详细介绍了Scrapy爬虫框架的工作原理、架构和运作流程，包括Scrapy的安装步骤，以及如何在Java环境中启动Scrapy爬虫。通过实例展示了创建Scrapy项目、定义目标、制作爬虫和存储内容的过程，帮助读者快速掌握Scrapy爬虫的使用。

摘要由CSDN通过智能技术生成

Scrapy是用纯Python实现一个为了爬取网站数据、提取结构性数据而编写的应用框架，用途非常广泛。

框架的力量，用户只需要定制开发几个模块就可以轻松的实现一个爬虫，用来抓取网页内容以及各种图片，非常之方便。

Scrapy 使用了 Twisted(其主要对手是Tornado)多线程异步网络框架来处理网络通讯，可以加快我们的下载速度，不用自己去实现异步框架，并且包含了各种中间件接口，可以灵活的完成各种需求。

1 Scrapy架构图(绿线是数据流向)

Scrapy Engine(引擎): 负责Spider、ItemPipeline、Downloader、Scheduler中间通讯，信号、数据传递等。

Scheduler(调度器): 它负责接受引擎发送过来的Request请求，并按照一定的方式进行整理排队，当引擎需要时，交还给引擎。

Downloader(下载器)：负责下载Scrapy Engine(引擎)发送的所有Requests请求，并将其获取到的Responses交还给Scrapy Engine(引擎)，由引擎交给Spider来处理.

Spider(爬虫)：它负责处理所有Responses,从中分析提取数据，获取Item字段需要的数据，并将需要跟进的URL提交给引擎，再次进入Scheduler(调度器)，

Item Pipeline(管道)：负责处理Spider中获取到的Item，并进行后期处理(分析、过滤、存储等)地方.

Downloader Middlewares(下载中间件)：你可以当作是一个可以自定义扩展下载功能的组件。

Spider Middlewares(Spider中间件)：你可以理解为是一个可以自定扩展和操作引擎和Spider中间通信的功能组件(比如进入Spider的Responses;和从Spider出去的Requests)

2 Scrapy的运作流程

代码写好，程序开始运行...

引擎：Hi！Spider, 你要处理哪一个网站？

Spider：老大要我处理xxxx.com。

引擎：你把第一个需要处理的URL给我吧。

Spider：给你，第一个URL是xxxxxxx.com。

引擎：Hi！调度器，我这有request请求你帮我排序入队一下。

调度器：好的，正在处理你等一下。

引擎：Hi！调度

最低0.47元/天解锁文章

weixin_32243075

关注

0
点赞
踩
2

收藏

觉得还不错? 一键收藏
0
评论
java启动scrapy爬虫,爬虫入门之Scrapy 框架基础功能(九)详解

Scrapy是用纯Python实现一个为了爬取网站数据、提取结构性数据而编写的应用框架，用途非常广泛。框架的力量，用户只需要定制开发几个模块就可以轻松的实现一个爬虫，用来抓取网页内容以及各种图片，非常之方便。Scrapy 使用了 Twisted(其主要对手是Tornado)多线程异步网络框架来处理网络通讯，可以加快我们的下载速度，不用自己去实现异步框架，并且包含了各种中间件接口，可以灵活的完成各种...
复制链接

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。