html登录页面源码_Scrapy笔记- 模拟登录

最新推荐文章于 2024-05-24 20:18:36 发布

weixin_39594080

最新推荐文章于 2024-05-24 20:18:36 发布

阅读量110

点赞数

文章标签： html登录页面源码

Scrapy笔记- 模拟登录

有时候爬取网站的时候需要登录，在Scrapy中可以通过模拟登录保存cookie后再去爬取相应的页面。这里我通过登录github然后爬取自己的issue列表来演示下整个原理。

要想实现登录就需要表单提交，先通过浏览器访问github的登录页面https://github.com/login，然后使用浏览器调试工具来得到登录时需要提交什么东西。

我这里使用chrome浏览器的调试工具，F12打开后选择Network，并将Preserve log勾上。我故意输入错误的用户名和密码，得到它提交的form表单参数还有POST提交的UR

去查看html源码会发现表单里面有个隐藏的authenticity_token值，这个是需要先获取然后跟用户名和密码一起提交的。

重写start_requests方法

要使用cookie，第一步得打开它呀，默认scrapy使用CookiesMiddleware中间件，并且打开了。如果你之前禁止过，请设置如下

COOKIES_ENABLES = True

我们先要打开登录页面，获取authenticity_token值，这里我重写了start_requests方法

# 重写了爬虫类的方法, 实现了自定义请求, 运行成功后会调用callback回调函数def start_requests(self): return [Request("https://github.com/login

关注