1.安装scrapy框架
#打开命令行输入如下命令
pip install scrapy
2.创建一个scrapy项目
打开命令行,输入
scrapy startproject project_name
这个命令会在当前目录创建一个scrapy爬虫项目,项目文件夹结构如下:
yourproject/
scrapy.cfg
yourproject/
__init__.py
items.py
pipelines.py
settings.py
spiders/
__init__.py
...
这些文件分别是:
scrapy.cfg: 项目的配置文件
tutorial/: 该项目的python模块。该项目的所有代码都在这个目录下
tutorial/items.py: 项目中的item文件,定义要爬取的数据
tutorial/pipelines.py:项目中的pipelines文件(我把这个称为通道文件,意思就是文件处理的通道),对爬取到的数据进行处理(如:储存)
tutorial/settings.py: 项目的设置文件.设置全局变量的值、通道的开启和关闭以及多个通道和爬虫的执行优先级
tutorial/spiders/: 放置spider代码的目录
下一篇:python学习(三)scrapy爬虫框架(二)——创建一个scrapy爬虫
.