Python+selenium使用cookie登录淘宝

众所周知,使用常规方法爬取淘宝的难度是很高的,所以使用selenium+浏览器几乎成了爬取淘宝最理想的方法。然而现在淘宝搜索需要用户登录才可以,据说是为了收集匹配用户信息。
淘宝搜索需要登录
而每次使用selenium时(+chrome),chromedriver会新打开一个浏览器窗口,所以添加cookie便显得很必要了。
这里看一下selenium的add_cookie方法
在这里插入图片描述
与普通的在headers里添加{'Cookies':' '}不一样的是,此方法需要按照cookie的name,value,path,domain格式逐个cookie添加,如下图
在这里插入图片描述
淘宝的cookie很多,所以需要逐项添加
而手动复制的话很不方便,所以这里使用到一个chrome插件
EditThisCookie
baidu
它有个导出功能,当你登录完淘宝后点击导出便会得到一个list格式的字符串

cookies=
[
{
    "domain": ".baidu.com",
    "expirationDate": 1563853177.468827,
    "hostOnly": false,
    "httpOnly": false,
    "name": "BAIDUID",
    "path": "/",
    "sameSite": "no_restriction",
    "secure": false,
    "session": false,
    "storeId": "0",
    "value": "C0E2BCF5DCEB680B2453F78AC4CD0956:FG=1",
    "id": 1
},
{
    "domain": ".baidu.com",
    "expirationDate": 1546756058.11283,
    "hostOnly": false,
    "httpOnly": false,
    "name": "BDORZ",
    "path": "/",
    "sameSite": "no_restriction",
    "secure": false,
    "session": false,
    "storeId": "0",
    "value": "FFFB88E999055A3F8A630C64834BD6D0",
    "id": 2
},
{
    "domain": ".baidu.com",
    "expirationDate": 3648534764.317173,
    "hostOnly": false,
    "httpOnly": false,
    "name": "BIDUPSID",
    "path": "/",
    "sameSite": "no_restriction",
    "secure": false,
    "session": false,
    "storeId": "0",
    "value": "CC0841B75FADCE2D56D45D685391FED0",
    "id": 3
},
{
    "domain": ".baidu.com",
    "hostOnly": false,
    "httpOnly": false,
    "name": "H_PS_PSSID",
    "path": "/",
    "sameSite": "no_restriction",
    "secure": false,
    "session": true,
    "storeId": "0",
    "value": "",
    "id": 4
},
{
    "domain": ".baidu.com",
    "expirationDate": 2493441539.633233,
    "hostOnly": false,
    "httpOnly": false,
    "name": "MCITY",
    "path": "/",
    "sameSite": "no_restriction",
    "secure": false,
    "session": false,
    "storeId": "0",
    "value": "-%3A",
    "id": 5
},
{
    "domain": ".baidu.com",
    "expirationDate": 3648534764.317246,
    "hostOnly": false,
    "httpOnly": false,
    "name": "PSTM",
    "path": "/",
    "sameSite": "no_restriction",
    "secure": false,
    "session": false,
    "storeId": "0",
    "value": "1501051117",
    "id": 6
},
{
    "domain": ".www.baidu.com",
    "expirationDate": 2492662056,
    "hostOnly": false,
    "httpOnly": false,
    "name": "bdime",
    "path": "/",
    "sameSite": "no_restriction",
    "secure": false,
    "session": false,
    "storeId": "0",
    "value": "0",
    "id": 7
}
]

稍加修改就可以作为python的list来导入cookie了

for item in cookies:
	driver.add_cookie(item)

之后使用selenium就可以正常搜索了
在这里插入图片描述

  • 5
    点赞
  • 28
    收藏
    觉得还不错? 一键收藏
  • 1
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值