参考链接 https://www.cnblogs.com/TurboWay/p/8172246.html
原文讲的很详细,本文只是根据自己的理解,稍作修改
1、概要
从西刺免费代理IP网站获取可用ip地址并保存为txt格式的本地文件,以便其他爬虫程序调用。
如下图所示,获取“国内高匿代理”、“国内普通代理”、“国内HTTPS代理”、“国内HTTP代理”四种代理的ip地址和端口,并验证ip:端口是否可用
2、主要代码
#!/usr/bin/env python3
# -*- coding: utf-8 -*-
import requests,threading,datetime
from bs4 import BeautifulSoup
import random
"""
1、抓取西刺代理网站的代理ip
2、并根据指定的目标url,对抓取到ip的有效性进行验证
3、最后存到指定的path
"""
# ------------------------------------------------------文档处理--------------------------------------------------------
# 写入文档
def write(path,text):
with open(path,'a', encoding='utf-8') as f:
#writelines可以把列表内容逐个写到文本文件中,此处换成write也可以
f.writelines(text)
f.write('\n')
# 清空文档
def truncatefile(path):
with open(path, 'w', encoding='utf-8') as f:
#f.truncate(5)会截取从文件开头到5字节大小的长度,为空或0size表示清空文件
f.truncate()
# 读取文档,此处读取文档主要是为了统计有效ip的个数
def read(path):
with open(path, 'r', encoding='utf-8') as f:
txt = []
for s in f.readlines():
txt.append(s.strip())
return txt
# ----------------------------------------------------------------------------