Python:爬取免费代理IP创建自己的代理IP池

在进行爬虫时,有时候爬取的次数多了或者短时间太过频繁就会出现无法访问的情况,此时是网站封了我们的IP ,为了避免这种情况,我们可以设置代理IP池,通过爬取免费代理IP网站获取代理IP ,然后不断测试更新代理IP池。由于免费的代理IP的不稳定性,因此只能是给大家提供个参考,在真正应用到工程时还是需要有稳定的代理IP。

下载运行ProxyPool

  • step1: 下载ProxyPool代码,按照说明配置好Python环境:安装redis数据库,并启动服务,然后安装Python依赖包

pip install redis
pip install -r requirements.txt

  • step2:修改test_url,在proxpool/setting.py中将TEST_URL修改为需要爬取的网站。
  • step3:最后运行run.py文件,成功运行后,打开http://127.0.0.1:5555/,如下图所示,即为成功。
    在这里插入图片描述
    再访问:http://127.0.0.1:5555/random,即可获取随机可用代理。
    注意事项:
  • 可以自行判断代码中爬取的IP网址是否还可用,不能用的可以删除,也可以自己添加新的IP代理网站爬取代码;
  • 由于免费的代理IP极不稳定,所有有时候获取的代理IP池中的IP可能随时都不能用了。
参考文献
  • 《Python3 网络爬虫开发实战》
  • 2
    点赞
  • 2
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值