Scrapy是一个快速功能强大的网络爬虫框架
scrapy的安装
pip install scrapy
构架结构
5+2结构
1.Engine
(1) 控制所有模块之间的数据流
(2) 根据条件触发事件
不需要用户修改
2.Downloader
根据请求下载网页
不需要用户修改
3.Scheduler
对所有爬取请求进行调度管理
不需要用户修改
4.Downloader Middleware
目的:实施Engine、Scheduler和Downloader
之间进行用户可配置的控制
功能:修改、丢弃、新增请求或响应
用户可以编写配置代码
5.Spider
(1) 解析Downloader返回的响应(Response)
(2) 产生爬取项(scraped item)
(3) 产生额外的爬取请求(Request) “5+2”结构
需要用户编写配置代码
6.Item Pipelines
(1) 以流水线方式处理Spider产生的爬取项
(2) 由一组操作顺序组成,类似流水线,每个操
作是一个Item Pipeline类型
(3) 可能操作包括:清理、检验和查重爬取项中
的HTML数据、将数据存储到数据库