之前的那个系列文章只是讲到了如何使用Scrapy来爬取文本数据,今天我们来介绍如何用Scrapy来爬取图片数据。
Scrapy爬取图片数据需要用到ImagePipeline这个类,此类提供一种方便的方式来下载和存储图片,待会大家看例子的时候就可以看到爬取图片要比爬取文本简单的多,这当然要归功于ImagePipeline这个类。
这个类的主要特征如下:
- 将下载图片转换成通用的JPG和RGB文件格式
- 避免重复下载
- 可以生成缩略图
- 图片大小可以实现自动过滤
下面我们来看一下ImagePipeline的工作流程
- 爬取一个item,将图片的urls存入image_urls字段
- 从Spider返回的item,传递到Item Pipeline,
当Item传递到ImagePipeline后,将调用Scrapy调度器和下载器完成image_urls中的URL的调度和下载。ImagePipeline会自动高优先级抓取这些url,与此同时,item会被锁定直到图片抓取完毕才解锁。
- 这些图片下载完成后,图片下载路径、url和校验等信息会被填充到images字段中。
好了,让我们赶紧开始吧。
启动一个项目,项目名称为douban_img
scrapy startproject douban_img