python爬虫-简单代理IP池的搭建与使用

最新推荐文章于 2024-07-30 09:46:31 发布

莫莫先生

最新推荐文章于 2024-07-30 09:46:31 发布

阅读量1.5w

点赞数 10

分类专栏： # Python爬虫学习文章标签：代理ip 应对反爬虫爬虫

本文链接：https://blog.csdn.net/weixin_44835732/article/details/103267942

版权

本文介绍了如何搭建和使用Python代理IP池来应对爬虫被封IP的问题。作者从解析代理IP网站获取数据开始，通过验证IP有效性，然后将有效IP存储到Excel，并提供读取和使用IP的函数。提供了部分代码供参考。

摘要由CSDN通过智能技术生成

前言：常爬爬网站，总有些害怕突然返回一个不是200的状态码，不是网不好，就是被反爬了，不过大多数网站还是蛮“友好”的，但难免还是会被网站封了IP，于是乎想到了前辈们说的代理ip池，咱学习学习，自己也整一个，好了，开干。

思路

IP代理池的搭建及使用需要实现以下几点功能

找到合适的代理ip的网站（西刺代理）
解析网页获取ip
判断ip是否有效
读写数据

一、解析网页获取ip

分析以下几点，我们可知ip信息都存在于tr标签内，先使用xpath对该网页基础解析，代码如下：root.xpath("//tr[@class=''] | //tr[@class='odd']")，将其划分为一个个的tr标签块，
再对每个tr块进行处理，将我们所需要的信息解析出来，我这里需要它的ip地址、端口号、服务器类型，代码如下

ip_address = tr.xpath("td[2]/text()")[0]  # ip地址
ip_port = tr.xpath("td[3]/text()")[0]  # ip端口号
ip_protocol = tr.xpath("td[6]/text()")[0]  # ip网络协议
ip = "{}://{}:{}".format(ip_protocol, ip_address, ip_port)

如此，我们所需要的ip就获取到了，但大多数的ip可能是无用的，所以我们要一一对其验证一下，紧接着下一步：判断ip是否有效

二、判断ip是否有效

我这里就用一下百度的网址（https://www.baidu.com/）做一下验证，通过访问网址返回的状态码确认ip是否有效，代码如下

response = requests.get(url="https://www.baidu.com/", headers=headers, proxies=proxies, timeout=30)
if response.status_code == 200:
    print(proxies, "            OK")
    return True
else:
    return False

注： proxies的类型是一个字典，格式为：{服务器类型: 完整IP}

三、存取代理ip

（一）存数据

有了有效的ip数据，我们当然要存起来嘛，想想我们的目的是什么：造池子，干嘛用：放很多代理IP，噢噢噢噢，存起来，我这就用Excel表存起来，因为有多组数据，所以这里使用的是向Excel表中追加数据，代码如下

# 追加填写数据
def write_excel(excelFilePath, values):
    data = openpyxl.load_workbook(excelFilePath)
    table = data.active
    nrows = table.max_row  # 获得行数
    # 注意 行 列下标是从1开始的
    for i in range(1, len(values) + 1):  # 行
        for j in range(1, len(values[i - 1]) + 1):  # 列
            table.cell(nrows + i, j).value = values[i - 1][j - 1]
    data.save(excelFilePath)