scrapy简单使用

最新推荐文章于 2024-08-17 12:57:11 发布

weixin_34221775

最新推荐文章于 2024-08-17 12:57:11 发布

阅读量47

点赞数

文章标签：爬虫 python 操作系统

原文链接：http://www.cnblogs.com/MC-Curry/p/9487434.html

版权

#settings.py文件设置

#如果网站中没有robots文件，就不会抓取任何数据

ROBOTSTXT_OBEY = False

#设置请求头

DEFAULT_REQUEST_HEADERS = {

　　'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; …) Gecko/20100101 Firefox/61.0'

}

#启动pipline（文件68行，取消注释即可）

ITEM_PIPELINES = {
'qsbk.pipelines.QsbkPipeline': 300,
}

#创建项目和爬虫

1.创建项目：'scrapy startproject [爬虫的名字]'

2.创建爬虫：进入到项目所在的路径，执行命令 'scrapy genspider [爬虫名字] [爬虫域名]'

注意：爬虫名字不能和项目名一样

#项目目录结构

1.items.py: 用来存放爬虫爬取下来的数据的模型

2.middlewares.py: 用来存放各种中间件的文件

3.pipelines.py: 用来将items的模型存储到本地磁盘中

4.settings.py: 本爬虫的一些配置信息（比如请求头，多久发送一次请求，ip代理池等）

5.scrapy.cfg: 项目的配置文件

6.spider包: 以后所有的爬虫都放到这个里面

转载于:https://www.cnblogs.com/MC-Curry/p/9487434.html

确定要放弃本次机会？

福利倒计时

: :

立减 ¥

普通VIP年卡可用

关注关注