使用scrapy爬取

最新推荐文章于 2023-03-04 20:17:51 发布

memoirs_pz

最新推荐文章于 2023-03-04 20:17:51 发布

阅读量1.6k

点赞数 1

文章标签： python

本文链接：https://blog.csdn.net/memoirs_pz/article/details/84722084

版权

本文介绍了如何使用Scrapy爬虫框架进行数据抓取，重点讲解了Scrapy的各个组件，包括引擎、调度器、下载器、蜘蛛、项目管道、下载器中间件、蜘蛛中间件和调度中间件。此外，还提到了Scrapy的安装方法，如通过pip或Anaconda，并详述了创建工程、定义items、编写pipeline和配置settings文件的步骤。

摘要由CSDN通过智能技术生成

了解scrapy框架，使用scrapy爬取酒店评论
python2.7.15

Scrapy是一个为了爬取网站数据，提取结构性数据而编写的应用框架。可以应用在包括数据挖掘，信息处理或存储历史数据等一系列的程序中。

scrapy分为以下几个工作部件
引擎(Scrapy Engine)，用来处理整个系统的数据流处理，触发事务(框架核心)。
调度器(Scheduler)，用来接受引擎发过来的请求，放入队列中，并在引擎再次请求的时候返回。
下载器(Downloader)，用于下载网页内容，并将网页内容返回给蜘蛛。
蜘蛛(Spiders)，蜘蛛就是我们以前写的爬虫，用它来制订特定域名或网页的解析规则。编写用于分析response并提取item(即获取到的item)或额外跟进的URL的类。每个spider负责处理一个特定(或一些)网站。
项目管道(Item Pipeline)，负责处理有蜘蛛从网页中抽取的项目，他的主要任务是清晰、验证和存储数据。当页面被蜘蛛解析后，将被发送到项目管道，并经过几个特定的次序处理数据。
下载器中间件(Downloader Middlewares)，位于Scrapy引擎和下载器之间的钩子框架，主要是处理Scrapy引擎与下载器之间的请求及响应。
蜘蛛中间件(Spider Middlewares)，介于Scrapy引擎和蜘蛛之间的钩子框架，主要工作是处理蜘蛛的响应输入和请求输出。
调度中间件(Scheduler Middlewares)，介于Scrapy引擎和调度之间的中间件，从Scrapy引擎发送到调度的请求和响应。

scrapy的安装

pip安装scrapy
这个会有很多包依赖，在安装scrapy

最低0.47元/天解锁文章

memoirs_pz

关注

1
点赞
踩
6

收藏

觉得还不错? 一键收藏
0
评论
使用scrapy爬取

了解scrapy框架，使用scrapy爬取酒店评论python2.7.15Scrapy是一个为了爬取网站数据，提取结构性数据而编写的应用框架。可以应用在包括数据挖掘，信息处理或存储历史数据等一系列的程序中。scrapy分为以下几个工作部件引擎(Scrapy Engine)，用来处理整个系统的数据流处理，触发事务(框架核心)。调度器(Scheduler)，用来接受引擎发过来的请求，放入队...
复制链接

扫一扫