Python3 获取用于爬虫的有效代理ip

本文介绍如何从西刺网站获取免费的高匿、普通、HTTPS和HTTP代理IP,并将其保存到本地文件,供爬虫程序使用。通过Python代码实现IP地址和端口的验证与保存。
摘要由CSDN通过智能技术生成

参考链接 https://www.cnblogs.com/TurboWay/p/8172246.html
原文讲的很详细,本文只是根据自己的理解,稍作修改

1、概要

西刺免费代理IP网站获取可用ip地址并保存为txt格式的本地文件,以便其他爬虫程序调用。

如下图所示,获取“国内高匿代理”、“国内普通代理”、“国内HTTPS代理”、“国内HTTP代理”四种代理的ip地址和端口,并验证ip:端口是否可用
在这里插入图片描述

2、主要代码

#!/usr/bin/env python3
# -*- coding: utf-8 -*-
import requests,threading,datetime
from bs4 import BeautifulSoup
import random

"""
1、抓取西刺代理网站的代理ip
2、并根据指定的目标url,对抓取到ip的有效性进行验证
3、最后存到指定的path
"""

# ------------------------------------------------------文档处理--------------------------------------------------------
# 写入文档
def write(path,text):
    with open(path,'a', encoding='utf-8') as f:
        #writelines可以把列表内容逐个写到文本文件中,此处换成write也可以
        f.writelines(text)
        f.write('\n')
# 清空文档
def truncatefile(path):
    with open(path, 'w', encoding='utf-8') as f:
        #f.truncate(5)会截取从文件开头到5字节大小的长度,为空或0size表示清空文件
        f.truncate()
# 读取文档,此处读取文档主要是为了统计有效ip的个数
def read(path):
    with open(path, 'r', encoding='utf-8') as f:
        txt = []
        for s in f.readlines():
            txt.append(s.strip())
    return txt
# ----------------------------------------------------------------------------
  • 1
    点赞
  • 8
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值