python + seleinum +phantomjs 设置headers和proxy代理

最近因为工作需要使用selenium+phantomjs无头浏览器,其中遇到了一些坑,记录一下,尤其是关于phantomjs设置代理的问题。

基本使用

首先在python中导入使用的包,其中webdriver是要创建无头浏览器对象的模块,DesiredCapabilites这个类是浏览器对象的一些选项设置。

from selenium import webdriver
from selenium.webdriver.common.desired_capabilities import DesiredCapabilities

# 初始化浏览器对象
desired_cap = DesiredCapabilities.PHANTOMJS.copy()
driver = webdriver.PhantomJS(desired_capabilities=desired_cap)

修改请求头

在使用爬虫的过程中我们需要修改请求投中的user-agent防止被反爬,修改过程如下

desired_cap = DesiredCapabilities.PHANTOMJS.copy()
# 修改请求头中的UA
desired_cap['phantomjs.page.settings.userAgent'] = 'xxxxxx'
# 设置其他请求投信息,其中key为要修改的请求投键名
desired_cap['phantomjs.page.customHeaders.{}'.format(key)] = 'xxxx'
driver = webdriver.PhantomJS(desired_capabilities=desired_cap)

设置代理

在使用爬虫过程中,经常需要使用代理ip,网上关于这方面资料较少,我也是搜集了好久,记录一下

ip代理有静态ip代理和动态ip代理,先说静态ip,静态ip就是134.119.184.92:1080这样的代理,不需要使用验证信息,使用方法如下:

# 配置代理信息
proxy = [
    '--proxy=%s' % "218.60.8.83:3129", # 设置的代理ip
    '--proxy-type=http',               # 代理类型
    '--ignore-ssl-errors=true',        # 忽略https错误
]

# 在初始化浏览器对象的时候可以接收一个service_args的参数,使用这个参数设置代理
drive = webdriver.PhantomJS(service_args=proxy)

# 设置页面加载和js加载超时时间,超时立即报错,如下设置超时时间为10秒
drive.set_page_load_timeout(10)
drive.set_script_timeout(10)

# 这样代理就设置成功了,可以向百度发送请求验证ip是否可用
drive.get('http://www.baidu.com')

 以上是静态代理设置方法,但是我们时候使用的是动态代理,设置方法有所变化,需要在参数里加上验证使用的用户名和密码,代码如下:

# 代理设置如下:
proxy = [
    '--proxy=%s:%s' % (proxyHost, proxyPort),  # 代理服务器的域名
    '--proxy-type=http',                       # 代理类型
    '--proxy-auth=%s:%s' % (proxyUser, proxyPass),  # 代理验证所需的用户名和密码
    '--ignore-ssl-errors=true',                     # 忽略https错误
]

# 在初始化浏览器对象的时候可以接收一个service_args的参数,使用这个参数设置代理
drive = webdriver.PhantomJS(service_args=proxy)

# 设置页面加载和js加载超时时间,超时立即报错,如下设置超时时间为10秒
drive.set_page_load_timeout(10)
drive.set_script_timeout(10)

# 这样代理就设置成功了,可以向百度发送请求验证ip是否可用
drive.get('http://www.baidu.com')

 以上就是使用selenium + phantomjs无头浏览器设置headers和代理的方法。

 

  • 2
    点赞
  • 3
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值