Python爬虫实战之爬取网站全部图片(一)

最新推荐文章于 2025-10-20 00:16:10 发布

原创最新推荐文章于 2025-10-20 00:16:10 发布 · 10w+ 阅读

·

92

·

CC 4.0 BY-SA版权

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

文章标签：

#爬虫 #图片下载 #下载整站图片 #抓包分析

python 专栏收录该内容

12 篇文章

订阅专栏

本文详细介绍了如何使用Python爬虫获取网站所有图片的地址和名称，通过开发者工具分析XPath，获取请求头信息，处理404错误，并提供了所需的库和IDE版本。

部署运行你感兴趣的模型镜像

Python爬虫实战之爬取网站全部图片(二)

Python爬虫实战之通过ajax获得图片地址实现全站图片下载(三)

一.获得图片地址和图片名称

1.进入网址之后

按F12 打开开发人员工具点击elemnts

2.点击下图的小箭头选择主图中的任意一个图片那我们这里点击第一个图片

3.显示控制台为了验证xpath是否正确

4.通过xpath获得a的href 和 title.

(请放大看)我们看到他提示的是有10个我们回到网站中看一下在主页上数一下他确实是10个也就是说我们获得的href 和title是没有任何问题的那么留着为我们后面使用.

5.我们还需要访问这个链接的请求头的信息以备后面操作的时候来使用

这里可以看到没有什么特别的请求头

6.获得每套图里的所有图片.这也是我们的目的所在不然前面那么多工序不是浪费吗。

可以看到我们获得了11个链接地址不要被源码中的文字所迷惑

7.获得相应的请求头

可以发现需要注意的只有一个字段Referer 这里的地址就是我们访问这个页面进来的时候的那个地址只要把那个地址给上就行了

8.对于404的处理如果出现了404那就只有重新请求了

二.编写python代码实现爬取.

1.需要用到的库有:

Requests lxml

2.IDE : pycharm

3.python 版本: 2.7.15

下载地址: https://download.csdn.net/download/qq_33958297/12195656

您可能感兴趣的与本文相关的镜像

Python3.10

Python3.10

Conda

Python

Python 是一种高级、解释型、通用的编程语言，以其简洁易读的语法而闻名，适用于广泛的应用，包括Web开发、数据分析、人工智能和自动化脚本

评论 41

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。