Python 爬虫模拟登录方法汇总

最新推荐文章于 2024-08-28 01:52:01 发布

weixin_34357928

最新推荐文章于 2024-08-28 01:52:01 发布

阅读量3.3k

点赞数 3

文章标签： python 爬虫测试

原文链接：https://juejin.im/post/5bd6acdbf265da0aba710136

版权

本文介绍了Python爬虫模拟登录的三种方法：POST请求、添加Cookies和Selenium模拟。详细讲解了每种方法的实现步骤，以桔子网为例，帮助读者掌握登录后爬取数据的技巧。

摘要由CSDN通过智能技术生成

摘要： 在进行爬虫时，除了常见的不用登录就能爬取的网站，还有一类需要先登录的网站。比如豆瓣、知乎，以及上一篇文章中的桔子网。这一类网站又可以分为：只需输入帐号密码、除了帐号密码还需输入或点击验证码等类型。本文以只需输入账号密码就能登录的桔子网为例，介绍模拟登录常用的 3 种方法。

POST 请求方法：需要在后台获取登录的 URL并填写请求体参数，然后 POST 请求登录，相对麻烦；
添加 Cookies 方法：先登录将获取到的 Cookies 加入 Headers 中，最后用 GET 方法请求登录，这种最为方便；
Selenium 模拟登录：代替手工操作，自动完成账号和密码的输入，简单但速度比较慢。

下面，我们用代码分别实现上述 3 种方法。

1. 目标网页

这是我们要获取内容的网页：

radar.itjuzi.com/investevent

这个网页需要先登录才能看到数据信息，登录界面如下：

可以看到，只需要输入账号和密码就可以登录，不用输验证码，比较简单。下面我们利用一个测试账号和密码，来实现模拟登录。

2. POST 提交请求登录

首先，我们要找到 POST 请求的 URL。

有两种方法，第一种是在网页 devtools 查看请求，第二种是在 Fiddler 软件中查看。

先说第一种方法。

在登录界面输入账号密码，并打开开发者工具，清空所有请求，接着点击登录按钮，这时便会看到有大量请求产生。哪一个才是 POST 请求的 URL呢？这个需要一点经验，因为是登录，所以可以尝试点击带有「login」字眼的请求。这里我们点击第四个请求，在右侧 Headers 中可以看到请求的 URL，请求方式是 POST类型，说明 URL 找对了。

接着，我们下拉到 Form Data，这里有几个参数，包括 identify 和 password，这两个参数正是我们登录时需要输入的账号和密码，也就是 POST 请求需要携带的参数。

参数构造非常简单，接下来只需要利用 Requests.post 方法请求登录网站，然后就可以爬取内容了。

下面

最低0.47元/天解锁文章

weixin_34357928

关注

3
点赞
踩
70

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。