基于Scrapy架构的网络爬虫入坑第三战（爬取某网站**头像到本地）

最新推荐文章于 2023-02-15 20:24:44 发布

jiguangdaru

最新推荐文章于 2023-02-15 20:24:44 发布

阅读量219

点赞数

分类专栏：爬

本文链接：https://blog.csdn.net/jiguangdaru/article/details/82973513

版权

爬专栏收录该内容

4 篇文章 0 订阅

订阅专栏

本文介绍了如何使用Scrapy架构编写爬虫，通过定位网站中头像的class属性，抓取头像URL，利用urllib.request模块下载图片并保存到本地。爬虫程序简化了手动保存图片的步骤，实现批量下载。

摘要由CSDN通过智能技术生成

一、前言

在Internet surfing的时候，经常会有这样的感叹：有些图片能自动保存到本地多好！省去右键另存为的麻烦，而且可以批量操作。

比如这样：

二、方法

首先观察网站涉及头像的源码，发现头像的网络地址在class = 'pic'的style中，截图如下：

而后想到借助最近一直摸索的Scrapy架构，写一个爬虫程序：先定位到用户主页，利用urllib.request.urlopen头像网址，并将图片信息写到本地。爬取流程如下：

相较于前两战，修改的代码也主要集中于Spider主函数文件，主要增加一个图片下载的函数：

    # 下载图片
    def imageDownload(self,titlename,url_img):
    #         print("开始")
        file_path = 'E:\Works\image\hunlian'
        if not os.path.exists(file_path):
            os.mkdir(file_path)
        file_path=os.path.join(file_path, titlename +'.jpg')
        response = urllib.request.urlopen(url_img)
        print("开始下载图片")
        print(file_path)
        with open(file_path,'wb') as f:
            f.write(response.read())

三、效果

运行爬虫程序，便可将头像保存到本地。具体效果图如下：