1. 高考派大学数据----写在前面
终于写到了scrapy
爬虫框架了,这个框架可以说是python爬虫框架里面出镜率最高的一个了,我们接下来重点研究一下它的使用规则。
安装过程自己百度一下,就能找到3种以上的安装手法,哪一个都可以安装上
可以参考 https://scrapy-chs.readthedocs.io/zh_CN/0.24/intro/install.html
官方说明进行安装。
2. 高考派大学数据----创建scrapy项目
通用使用下面的命令,创建即可
scrapy startproject mySpider
完成之后,你的项目的目录结构为
每个文件对应的意思为
- scrapy.cfg 项目的配置文件
- mySpider/ 根目录
- mySpider/items.py 项目的目标文件,规范数据格式,用来定义解析对象对应的属性或字段。
- mySpider/pipelines.py 项目的管道文件,负责处理被spider提取出来的item。典型的处理有清理、 验证及持久化(例如存取到数据库)
- mySpider/settings.py 项目的设置文件
- mySpider/spiders/ 爬虫主目录
- middlewares.p