scrapy爬虫框架

scrapy爬虫工作原理

scrapy爬虫工作原理

scrapy框架组件说明

Item

Item:用于声明需要在页面上抓取的内容,每个内容为一个Field。Item、Field都实现了dict接口。
Field的作用是可以为每一个提取到的值定义任意的metadata。

parse函数

parse函数为在框架抓取完url默认的response回调函数(如果Request没有指定callback,则使用parse函数),也是爬虫处理逻辑开始的入口函数。在该函数中可以返回Request对象;Item对象;dict对象;或者它们的列表。

Downloader Middleware

默认的Middleware包括:
{
‘scrapy.contrib.downloadermiddleware.robotstxt.RobotsTxtMiddleware’: 100,
‘scrapy.contrib.downloadermiddleware.httpauth.HttpAuthMiddleware’: 300,
‘scrapy.contrib.downloadermiddleware.downloadtimeout.DownloadTimeoutMiddleware’: 350,
‘scrapy.contrib.downloadermiddleware.useragent.UserAgentMiddleware’: 400,
‘scrapy.contrib.downloadermiddleware.retry.RetryMiddleware’: 500,
‘scrapy.contrib.downloadermiddleware.defaultheaders.DefaultHeadersMiddleware’: 550,
‘scrapy.contrib.downloadermiddleware.redirect.MetaRefreshMiddleware’: 580,
‘scrapy.contrib.downloadermiddleware.httpcompression.HttpCompressionMiddleware’: 590,
‘scrapy.contrib.downloadermiddleware.redirect.RedirectMiddleware’: 600,
‘scrapy.contrib.downloadermiddleware.cookies.CookiesMiddleware’: 700,
‘scrapy.contrib.downloadermiddleware.httpproxy.HttpProxyMiddleware’: 750,
‘scrapy.contrib.downloadermiddleware.chunked.ChunkedTransferMiddleware’: 830,
‘scrapy.contrib.downloadermiddleware.stats.DownloaderStats’: 850,
‘scrapy.contrib.downloadermiddleware.httpcache.HttpCacheMiddleware’: 900,
}
如果想要取消某个Middleware,需要在DOWNLOADER_MIDDLEWARES将其值设为None

默认情况下,以下Middleware是生效的:
1. Retry:默认重试2次;
2. Redirect:默认情况下单一request最大深度为20;
3. UserAgent:如果要修改User-Agent,需要设置spider的user_agent属性;
4. Cookie

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值