1. 前言
众所周知,Python 最流行的爬虫框架是 Scrapy,它主要用于爬取网站结构性数据
今天推荐一款更加简单、轻量级,且功能强大的爬虫框架:feapder
项目地址:
https://github.com/Boris-code/feapder
2. 介绍及安装
和 Scrapy 类似,feapder 支持轻量级爬虫、分布式爬虫、批次爬虫、爬虫报警机制等功能
内置的 3 种爬虫如下:
-
AirSpider
轻量级爬虫,适合简单场景、数据量少的爬虫
-
Spider
分布式爬虫,基于 Redis,适用于海量数据,并且支持断点续爬、自动数据入库等功能
-
BatchSpider
分布式批次爬虫,主要用于需要周期性采集的爬虫
在实战之前,我们在虚拟环境下安装对应的依赖库
# 安装依赖库
pip3 install feapder
3. 实战一下
我们以最简单的 AirSpider 来爬取一些简单的数据
目标网站:aHR0cHM6Ly90b3BodWIudG9kYXkvIA==
详细实现步骤如下( 5 步)
3-1 创建爬虫项目
首先,我们使用「 feapder create -p 」命令创建一个爬虫项目
# 创建一个爬虫项目
feapder create -p tophub_demo
3-2 创建爬虫 AirSpider
命令行进入到 spiders 文件夹目录下&#