python爬虫中的https请求证书问题,原理及处理


理解https
https是HTTP+SSL的简称,是在HTTP传输方式的基础上将之前的明文进行了加密传输,在传输之前就会确定信息加密方式和秘钥,在传输中即使被捕获或者伪造,那么也能保证信息不被泄露。

而爬虫本质是伪装成一个浏览器,发送请求给服务器,参与了整个过程,所以即使https链接也能抓取,但前提是伪造的这个客户端有正确的SSL证书。

寻找错误根源
爬虫运行中提示SSL error错误的情况,一般是本地证书或者相关SSL库没有正确安装、服务器使用自己制作的CA证书,没有有权威机构认证



解决证书异常问题
对于CA证书问题我们可以参考下面集中方案:

1.不验证CA证书,但要忽略安全警告
coding=utf-8

import requests

# 不验证CA证书则需要忽略安全警告
方式一:
import urllib3
urllib3.disable_warnings()

方式二:
from requests.packages.urllib3.exceptions import InsecureRequestWarning
requests.packages.urllib3.disable_warnings(InsecureRequestWarning)

r=requests.get(url=“https://www.baidu.com/”,verify=False)

print r.elapsed.total_seconds()

2.指定证书位置或含证书的文件夹(此文件夹是由OpenSSL工具制作的)
coding=utf-8

import requests
r=requests.get(url=“https://www.baidu.com/”,verify='/path/to/certfile')

默认情况下verify是TRue

  • 0
    点赞
  • 7
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值