方法教程 | Python爬虫：爬取美女图片，看到了意想不到的场景美女图片

最新推荐文章于 2024-03-14 22:21:44 发布

yying333

最新推荐文章于 2024-03-14 22:21:44 发布

阅读量1.3k

点赞数 1

文章标签： python 爬虫正则表达式

本文链接：https://blog.csdn.net/yying333/article/details/120015808

版权

这篇博客介绍了如何使用Python进行动态网页的爬虫实践，重点讲解了如何处理JavaScript加载的内容，包括使用正则表达式解析数据，以及利用Selenium和PhantomJS处理动态网页。此外，还探讨了下载数据的模块如urllib和Requests，以及数据的保存方法。

摘要由CSDN通过智能技术生成

python练手项目——爬取网页美女图片

1.下载数据

动态网页

下载数据的模块

2.解析数据

正则表达式说明

3.保存数据

1.下载数据

首先打开要爬的网站，分析URL，每打开一个网页看URL有什么变化，有可能带上上个网页的某个数据，例如xxID之类，那么我们就需要在上一个页面分析HTML，找到对应的数据。如果网页源码找不到，可能是ajax异步加载，去xhr里去找。

有的网站做了反爬的处理，可以添加User-Agent ：判断浏览器


self.user_agent = 'Mozilla/4.0 (compatible; MSIE 5.5; Windows NT)'
# 初始化 headers
self.headers = {'User-Agent': self.user_agent}

如果不行，在Chrome上按F12分析请求头、请求体，看需不需要添加别的信息，例如有的网址添加了referer当前网页的来源，那么我们在请求的时候就可以带上。按Ctrl + Shift + C，可以定位元素在HTML上的位置

动态网页

有一些网页是动态网页，我们得到网页的时候，数据还没请求到呢，当然什么都提取

关注