爬虫项目实战十三：爬取zol桌面壁纸

最新推荐文章于 2022-02-27 00:37:03 发布

「已注销」

最新推荐文章于 2022-02-27 00:37:03 发布

阅读量1.2k

点赞数 3

分类专栏： python爬虫学习笔记

本文链接：https://blog.csdn.net/qq_44862120/article/details/108385875

版权

爬取zol桌面壁纸

目标

爬取zol桌面壁纸，批量下载图片。

项目准备

软件：Pycharm
第三方库：requests,fake_useragent,re,lxml
网站地址：http://desk.zol.com.cn/1920x1080/

项目分析

打开网站看一下。
在这里插入图片描述

每一个都是一个图集。
点开

查看源代码

可以看出每一个都可以在源代码中找到。判定为静态网页。

页码分析

第一页url链接：http://desk.zol.com.cn/1920x1080/1.html
第二页url链接：http://desk.zol.com.cn/1920x1080/2.html
第三页url链接：http://desk.zol.com.cn/1920x1080/3.html

可以发现每一页随着后面的数字而变化。
在这里插入图片描述

反爬分析

同一个ip地址去多次访问会面临被封掉的风险，这里采用fake_useragent，产生随机的User-Agent请求头进行访问。

代码实现

1.导入相对应的第三方库，定义一个class类继承object，定义init方法继承self，主函数main继承self。

import requests
from fake_useragent import UserAgent
import re
from lxml import etree
class bizhi(object):
    def __init__(self):
        self.url = 'http://desk.zol.com.cn/1920x1080/hot_{}.html'
        ua = UserAgent(verify_ssl=False)
        for i in range(1, 100):
            self.headers = {
   
                'User-Agent': ua.random
            }
    def main(self):
       pass
if __name__ == '__main__':
    spider = bizhi()
    spider.main()

2.发送请求,获取网页。

    def get_html(self,url):
        response = requests.get(url, headers=self.headers)
        html = response.content.decode('gb2312')
        return html

最低0.47元/天解锁文章

「已注销」

关注

3
点赞
踩
5

收藏

觉得还不错? 一键收藏
2
评论
爬虫项目实战十三：爬取zol桌面壁纸

爬取zol桌面壁纸目标项目准备项目分析页码分析反爬分析代码实现效果显示目标爬取zol桌面壁纸，批量下载图片。项目准备软件：Pycharm第三方库：requests,fake_useragent,re,lxml网站地址：http://desk.zol.com.cn/1920x1080/项目分析打开网站看一下。每一个都是一个图集。点开查看源代码可以看出每一个都可以在源代码中找到。判定为静态网页。页码分析第一页url链接：http://desk.zol.com.cn/192
复制链接

扫一扫