Python爬虫之Scrapy框架基础

我像影子一样

已于 2024-07-03 10:37:17 修改

阅读量1.6k

点赞数 14

分类专栏： python 文章标签： python 爬虫 scrapy

于 2024-04-10 18:08:32 首次发布

本文链接：https://blog.csdn.net/m0_56181660/article/details/137605636

版权

python 专栏收录该内容

18 篇文章 0 订阅

订阅专栏

Scrapy爬虫框架介绍

文档
- 英文文档
- 中文文档
什么是scrapy

基于twisted搭建的异步爬虫框架.

scrapy爬虫框架根据组件化设计理念和丰富的中间件, 使其成为了一个兼具高性能和高扩展的框架
scrapy提供的主要功能
- 具有优先级功能的调度器
- 去重功能
- 失败后的重试机制
- 并发限制
- ip使用次数限制
- …
scrapy的使用场景
- 不适合scrapy项目的场景
  - 业务非常简单, 对性能要求也没有那么高, 那么我们写多进程, 多线程, 异步脚本即可.
  - 业务非常复杂, 请求之间有顺序和失效时间的限制.
  - 如果你不遵守框架的主要设计理念, 那就不要使用框架
- 适合使用scrapy项目
  - 数据量大, 对性能有一定要求, 又需要用到去重功能和优先级功能的调度器
scrapy组件
- ENGINE从SPIDERS中获取初始请求任务Requests
- ENGINE得到Requests之后发送给SCHEDULER, SCHEDULER对请求进行调度后产出任务.
- Scheduler返回下一个请求任务给ENGINE
- ENGINE将请求任务交给DOWNLOADER去完成下载任务, 途径下载器中间件.
- 一旦下载器完成请求任务, 将产生一个Response对象给ENGINE, 途径下载器中间件
- ENGINE收到Response对象后, 将该对象发送给SPIDERS去解析和处理, 途径爬虫中间件
- SPIDER解析返回结果
  - 将解析结果ITEMS发送给ENGINE
  - 生成一个新的REQUESTS任务发送给ENGINE
- 如果ENGINE拿到的是ITEMS, 那么就会发送给ITEM PIPELINES做数据处理, 如果是REQUESTS则发送给SCHEDULER
- 周而复始, 直到没有任务产出

Scrapy教程

安装

  pip install scrapy

创建项目

 scrapy startproject jd_crawler_scrapy

目录结构
- spiders(目录)
  
  存放SPIDERS项目文件, 一个scrapy项目下可以有多个爬虫实例
- items
  
  解析后的结构化结果.
- middlewares
  
  下载器中间件和爬虫中间件的地方
- piplines
  
  处理items的组件, 一般都在pipelines中完成items插入数据表的操作
- settings
  
  统一化的全局爬虫配置文件
- scrapy.cfg
  
  项目配置文件
scrapy爬虫demo

  
  
  import scrapy
  
  
  class JdSearch(scrapy.Spider):
      name = "jd_search"
  
      def start_requests(self):
          for keyword in ["鼠标", "键盘", "显卡", "耳机"]:
              for page_num in range(1, 11):
                  url = f"https://search.jd.com/Search?keyword={keyword}&page={page_num}"
  
                  # 选用FormRequest是因为它既可以发送GET请求, 又可以发送POST请求
                  yield scrapy.FormRequest(
                      url=url,
                      method='GET',
                      # formdata=data,             # 如果是post请求, 携带数据使用formdata参数
                      callback=self.parse_search   # 指定回调函数处理response对象
                  )
  
  
      def parse_search(self, response):
          print(response)

启动爬虫

scrapy crawl spider_name

![在这里插入图片描述](https://img-blog.csdnimg.cn/direct/531628b2f82a419da1dd6529b2106dad.jpeg

Scrapy的启动和debug

命令行
scrapy crawl jd_search

启动脚本

# 新建run.py

from scrapy import cmdline

command = "scrapy crawl jd_search".split()
cmdline.execute(command)

Scrapy的中间件

请求头中间件

class UAMiddleware:
    def process_request(self, request, spider):
        request.headers["user-agent"] = "Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/87.0.4280.141 Safari/537.36"