爬取带验证码网站思路的小结

由于现在网站技术的发展及爬虫技术的推进,现在网站很多都有访问时需要填写验证码的问题,经过查询,现对验证码问题进行总结,如下:
1.IP代理 当我们频繁用一个IP登陆某个网站时,会出现需要填写验证码的问题,解决此种问题可以用IP代理的思路具体有三种方法:
(1)借用VPN,更换不同的线路,进而更换IP。
(2)IP代理池,借用一些厂商提供的IP代理池的API,更换IP
(3)ADSL,利用拨号上网每次分配不同IP的机制,实现更换IP
2 cookie登陆,为了避免每次登陆都要输入账号密码,验证码的麻烦,我们可以将登陆后的cookie存储到本地,访问网站时加入即可。
3.传统验证码识别。可以借助tesseract-ocr,pytesseract和Pillow
4.人工打码 当传统验证码识别难度加大时,可以结合自动识别和人工打码平台解决问题。
5.滑动验证码:可以结合selenium实现。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值