python使用scrapy-pyppeteer中间件使用代理IP

最新推荐文章于 2024-07-20 17:12:48 发布

小白学大数据

最新推荐文章于 2024-07-20 17:12:48 发布

阅读量761

点赞数 15

分类专栏：亿牛云代理文章标签： python scrapy 中间件爬虫

本文链接：https://blog.csdn.net/Z_suger7/article/details/137785390

版权

亿牛云代理专栏收录该内容

56 篇文章 0 订阅

订阅专栏

本文介绍了如何通过减少无用操作、使用pyppeteer_page_coroutines、设置并发数和延迟、以及利用缓存来提升Scrapy-Pyppeteer爬虫的效率，提供了一些建议和配置示例。

摘要由CSDN通过智能技术生成

要提高scrapy-pyppeteer的效率，可以考虑以下几个方面：

减少不必要的页面操作，如滚动、点击等，只执行对数据抓取有用的操作。
使用pyppeteer_page_coroutines参数传入一个可排序的迭代器（如列表、元组或字典），指定在返回响应之前需要在页面上执行的协程。这样可以避免多次调用page.evaluate方法。
设置合理的并发数和下载延迟，避免过多的请求导致浏览器崩溃或被目标网站封禁。
使用缓存或增量爬取，避免重复爬取相同的页面。

# settings.py
# -*- coding: utf-8 -*-

Sydney = 'scrapy_pyppeteer'

SPIDER_MODULES = ['scrapy_pyppeteer.spiders']
NEWSPIDER_MODULE = 'scrapy_pyppeteer.spiders'

# 设置下载中间件
DOWNLOADER_MIDDLEWARES = {
    'scrapy_pyppeteer.middlewares.PyppeteerMiddleware': 543,
    'scrapy_pyppeteer.middlewares.RandomUserAgentMiddleware': 544,
}

# 设置请求头
DEFAULT_REQUEST_HEADERS = {
    'Accept': '*/*',
    'Accept-Language': 'en',
}

# 设置日志级别
LOG_LEVEL = "DEBUG"

# 设置pyppeteer启动选项
PYPPETEER_LAUNCH_OPTIONS = {
    # 是否显示浏览器界面，默认False
    "headless": False,
    # 是否忽略HTTPS错误，默认False
    "ignoreHTTPSErrors": True,
    # 添加代理服务器的地址，格式为host:port或protocol://host:port
    "args": ["--proxy-server=www.16yun.cn:31111"]
}

# 设置并发数，默认16
CONCURRENT_REQUESTS = 8

# 设置下载延迟，默认0秒
DOWNLOAD_DELAY = 1

# 启用缓存，默认False
HTTPCACHE_ENABLED = True

# middlewares.py
# -*- coding: utf-8 -*-
import asyncio

import pyppeteer

from scrapy import signals, Request, Spider, http


class PyppeteerMiddleware:
    # 定义一个类属性browser，表示浏览器对象
    browser: pyppeteer.browser.Browser

    @classmethod
    def from_crawler(cls, crawler):
        # 创建中间件实例，并传入crawler对象作为参数