scrapy设置代理的方法

最新推荐文章于 2024-03-18 10:30:25 发布

埃菲尔没有塔尖

最新推荐文章于 2024-03-18 10:30:25 发布

阅读量1.2w

点赞数 4

分类专栏： Scarpy框架

本文链接：https://blog.csdn.net/weixin_38819889/article/details/109018429

版权

Scarpy框架专栏收录该内容

8 篇文章 5 订阅

订阅专栏

根据最新的scrapy官方文档,scrapy爬虫框架的代理配置有以下两种方法:

1.使用中间件DownloaderMiddleware进行配置

在settings.py文件中，找到DOWNLOADER_MIDDLEWARES它是专门用来用配置scrapy的中间件.我们可以在这里进行自己爬虫中间键的配置,配置后如下：

DOWNLOADER_MIDDLEWARES = {
    'WandoujiaCrawler.middlewares.ProxyMiddleware': 100,
}

其中WandoujiaCrawler是我们的项目名称，后面的数字代表中间件执行的优先级。

官方文档中默认proxy中间件的优先级编号是750，我们的中间件优先级要高于默认的proxy中间键。

中间件middlewares.py的写法如下(scrapy默认会在这个文件中写好一个中间件的模板,不用管它写在后面即可):

# -*- coding: utf-8 -*-
class ProxyMiddleware(object):
    def process_request(self, request, spider):
        request.meta['proxy'] = "http://proxy.yourproxy:8001"

这里有两个注意的问题:

1.是proxy一定是要写成 http:// 前缀，否则会出现to_bytes must receive a unicode, str or bytes object, got NoneType的错误.
2.是官方文档中写到process_request方法一定要返回request对象，response对象或None的一种,但是其实写的时候不用return,乱写可能会报错。另外如果代理有用户名密码等就需要在后面再加上一些内容:

# Use the following lines if your proxy requires authentication
proxy_user_pass = "USERNAME:PASSWORD"
# setup basic authentication for the proxy
encoded_user_pass = base64.encodestring(proxy_user_pass)
request.headers['Proxy-Authorization'] = 'Basic ' + encoded_user_pass

此处配置参考:
http://www.pythontab.com/html/2014/pythonweb_0326/724.html

2.直接在爬虫程序中设置proxy字段

我们可以直接在自己具体的爬虫程序中设置proxy字段,代码如下,直接在构造Request里面加上meta字段即可:

class QuotesSpider(scrapy.Spider):
    name = "quotes"
    def start_requests(self):
        urls = [
            'http://quotes.toscrape.com/page/1/',
            'http://quotes.toscrape.com/page/2/',
        ]
        for url in urls:
            yield scrapy.Request(url=url, callback=self.parse, 
            meta={'proxy': 'http://proxy.yourproxy:8001'})
 
    def parse(self, response):
        for quote in response.css('div.quote'):
            yield {
                'text': quote.css('span.text::text').extract_first(),
                'author': quote.css('span small::text').extract_first(),
                'tags': quote.css('div.tags a.tag::text').extract(),
            }

3:通过内置的环境变量

这是在我们的start_request里面，代码如下：（该方法比较low ，不推荐使用）

  def start_requests(self):
    	# 这里是代理ip
        import os
        os.environ["HTTPS_PROXY"] = '37.187.149.129:1080'
        os.environ["HTTP_PROXY"] = '202.29.212.213:443'
        # 重写了start_requests一定要重写这个不然不能爬取了。
        #方法一：
        #for url in self.start_urls:
         #   yield Request(url=url)
         # 方法二：
        request_list = []
        for url in self.start_urls:
            request_list.append(Request(url=url))
        return request_list

提示一下：meta的优先级要高于环境变量的。

埃菲尔没有塔尖

关注

4
点赞
踩
23

收藏

觉得还不错? 一键收藏
0
评论
scrapy设置代理的方法

根据最新的scrapy官方文档,scrapy爬虫框架的代理配置有以下两种方法:1.使用中间件DownloaderMiddleware进行配置在settings.py文件中，找到DOWNLOADER_MIDDLEWARES它是专门用来用配置scrapy的中间件.我们可以在这里进行自己爬虫中间键的配置,配置后如下：DOWNLOADER_MIDDLEWARES = { 'WandoujiaCrawler.middlewares.ProxyMiddleware': 100,}其中Wandouji
复制链接

扫一扫

专栏目录