Python网络爬虫案例实战：爬虫网络概述-会话和 Cookie

andyyah晓波

于 2024-08-08 09:31:01 发布

阅读量579

点赞数 16

分类专栏： Python网络爬虫案例实战文章标签：爬虫网络

本文链接：https://blog.csdn.net/andyyah/article/details/141017643

版权

Python网络爬虫案例实战专栏收录该内容

17 篇文章 0 订阅

订阅专栏

Python网络爬虫案例实战：爬虫网络概述-会话和 Cookie

在浏览网站的过程中，经常会遇到需要登录的情况，有些页面只有登录后才可以访问，而且登录之后可以连续访问很多次网站，但是有时候过一段时间就需要重新登录。还有些网站，在打开浏览器时就自动登录了，而且很长时间都不会失效，这又是为什么呢？其实涉及会话（Session）和 Cookie的相关知识，下面将揭开它们神秘的面纱。

1.7.1静态网页和动态网页

在开始之前，需要先了解静态网页和动态网页的概念。代码展示如下：
在这里插入图片描述

这是最基本的HTML 代码，将其保存为一个.HTML 文件，然后把它放在某台具有固定公网IP的主机上，主机上装上Apache或 Nginx等服务器，这样这台主机就可以作为服务器了，其他人便可以通过访问服务器看到这个页面，这就搭建了一个最简单的网站。
这种网页的内容是HTML 代码编写的，文字、图片等内容均通过写好的HTML 代码来指定，这种页面叫作静态网页。它加载速度快、编写简单，但是存在很大的缺陷，如可维护性差，不能根据URL灵活多变地显示内容等。例如，想要给这个网页的URL 传入一个name参数，让其他网页中显示出来，是无法做到的。
因此，动态网页应运而生，它可以动态解析URL 中参数的变化，关联数据库并动态呈现不同的页面内容，非常灵活多变。现在遇到的大多数网站都是动态网站，它们不再是一个简单的HTML，而是可能由JSP、PHP、Python等语言编写的，其功能比静态网页强大和丰富许多。
此外，动态网站还可以实现用户登录和注册的功能。再回到开头提到的问题，很多页面是需要登录之后才可以查看的。按照一般的逻辑来说，输入用户名和密码登录之后，肯定是拿到了一种类似凭证的东西，有了它，才能保持登录状态，才能访问登录之后才可以看到的页面。
那么，这种神秘的凭证到底是什么呢？它就是会话和 Cookie共同产生的结果，下面来探一探究竟。

1.7.2无状态HTTP

在了解会话和 Cookie之前，还需要了解HTTP的一个特点，叫作无状态。
HTTP 的无状态是指HTTP 协议对事务处理是没有记忆能力的，也就是服务器不知道客户端是什么状态。当我们向服务器发送请求后，服务器解析此请求，然后返回对应的响应，服务器负责完成这个过程。而且这个过程是完全独立的，服务器不会记录前后状态的变化，也就是缺少状态记录。这意味着如果后续需要处理前面的信息，则必须重传，这导致需要额外传递一些前面的重复请求，才能获取后续响应，然而这种效果显然不是我们想要的。为了保持前后状态，肯定不能将前面的请求全部重传一次，这太浪费资源了，对于这种需要用户登录的页面来说，更是棘手。
这时两个用于保持HTTP连接状态的技术就出现了，它们分别是会话和Cookie。会话在服务端，也就是网站的服务器，用来保存用户的会话信息；Cookie在客户端，也可以理解为浏览器端，有了Cookie，浏览器在下次访问网页时会自动附带上它发送给服务器，服务器通过识别 Cookie并鉴定出是哪个用户，然后再判断用户是否登录状态，然后返回对应的响应。
可以理解为 Cookie 中保存了登录的凭证，有了它，在下次携带 Cookie发送请求时就不必重新输入用户名、密码等信息重新登录了。
因此在爬虫中，有时候处理需要登录才能访问的页面时，一般会直接将登录成功后获取的Cookie放在请求中直接请求，而不必重新模拟登录。下面剖析Cookie及会话的原理。
1.会话
会话，其本来含义是指有始有终的一系列动作/消息。比如，打电话时，从拿起电话拨号到挂断电话这中间的一系列过程可以称为一个会话。
而在Web中，会话对象用来存储特定用户会话所需的属性及配置信息。这样，当用户在应用程序的Web页之间跳转时，存储在会话对象中的变量将不会丢失，而是在整个用户会话中一直存在下去。当用户请求来自应用程序的Web页时，如果该用户还没有会话，则 Web服务器将自动创建一个会话对象。当会话过期或被放弃后，服务器将终止该会话。
2.Cookie Cookie指某些网站为了辨别用户身份、进行会话跟踪而存储在用户本地终端上的数据。
1）会话维持
那么，怎样利用Cookie保持状态呢？当客户端第一次请求服务器时，服务器会返回一个请求头中带有Set-Cookie字段的响应给客户端，用来标记是哪一个用户，客户端浏览器会把 Cookie保存起来。当浏览器下一次再请求该网站时，浏览器会把此 Cookie放到请求头一起提交给服务器，Cookie携带了会话ID信息，服务器检查该Cookie即可找到对应的会话是什么，然后再判断会话以辨认用户状态。
在成功登录某个网站时，服务器会告诉客户端设置哪些 Cookie信息，在后续访问页面时客户端会把 Cookie发送给服务器，服务器再找到对应的会话加以判断。如果会话中的某些设置登录状态的变量是有效的，则证明用户处于登录状态，此时返回登录之后才可以查看的网页内容，浏览器再进行解析便可以看到了。
反之，如果传给服务器的Cookie是无效的，或者会话已经过期了，那么将不能继续访问页面，此时可能收到错误的响应或者跳转到登录页面重新登录。
所以，Cookie 和会话需要配合，一个处于客户端，一个处于服务端，二者共同协作，就实现了登录会话控制。
2）属性结构
接着，来看看 Cookie都有哪些内容。一样以百度为例，在浏览器开发者工具中打开Application选项卡，然后在左侧会有一个Storage 部分，最后一项即为Cookie，将其点开，如图1-18所示。
从图1-18可以看到，这里有很多项目，其中每个项目可以称为 Cookie。它有如下几个属性。
Name：该Cookie的名称，一旦创建，该名称便不可更改。
Value：该Cookie的值，如果值为Unicode字符，需要为字符编码，如果值为二进制数据，则需要使用BASE64编码。
Domain：可以访问该Cookie的域名，例如，如果设置为baidu.com，则所有以baidu
.com结尾的域名都可以访问该Cookie。
在这里插入图片描述
Max Age：该Cookie失效的时间，单位为秒，也常和 Expires 一起使用，通过它可以计算出其有效时间。Max Age 如果为正数，则该Cookie在 Max Age秒之后失效。如果为负数，则关闭浏览器时 Cookie即失效，浏览器也不会以任何形式保存该Cookie。
Path：该Cookie的使用路径，如果设置为/path/，则只有路径为/path/的页面可以访问该Cookie。如果设置为/，则本域名下的所有页面都可以访问该Cookie。
Size字段：此 Cookie的大小。
HTTP字段：Cookie的httponly属性。如果此属性为true，则只有在HTTP头中会带有此 Cookie的信息，而不能通过document.Cookie访问此 Cookie。
Secure：该Cookie是否仅被使用安全协议传输。安全协议有HTTPTS 和 SSL等，在网络上传输数据之前先将数据加密，默认为false。
3）会话 Cookie和持久Cookie从表面意思来说，会话 Cookie 就是把Cookie放在浏览器内存里，浏览器在关闭之后该Cookie即失效；持久Cookie则会保存到客户端的硬盘中，下次还可以继续使用，用于长久保持用户登录状态。
其实严格来说，没有会话 Cookie和持久Cookie之分，只是由 Cookie的Max Age或 Expires字段决定了过期的时间。
因此，一些持久化登录的网站其实就是把Cookie的有效时间和会话有效时间设置得比较长，下次再访问页面时仍然携带之前的Cookie，就可以直接保持登录状态。

1.7.3常见误区

在谈论会话机制的时候，常常听到这样一种误解一–“只要关闭浏览器，会话就消失了”。可以想象一下会员卡的例子，除非顾客主动对店家提出销卡，否则店家绝对不会轻易删除顾客的资料。对会话来说，也是一样，除非程序通知服务器删除一个会话，否则服务器会一直保留。比如，程序一般都是在做注销操作时才删除会话。
但是当关闭浏览器时，浏览器不会主动在关闭之前通知服务器它将要关闭，所以服务器根本不会有机会知道浏览器已经关闭。之所以会有这种错觉，是因为大部分会话机制都使用会话 Cookie来保存会话ID信息，而关闭浏览器后 Cookie就消失了，再次连接服务器时，也就无法找到原来的会话了。如果服务器设置的Cookie保存到硬盘上，或者使用某种手段改写浏览器发出的HTTP请求头，把原来的Cookie发送给服务器，则再次打开浏览器，仍然能够找到原来的会话ID，依旧还是可以保持登录状态的。恰怡因为关闭浏览器不会导致会话被删除，这就需要服务器为会话设置一个失效时间，当距离客户端上一次使用会话的时间超过这个失效时间时，服务器就可以认为客户端已经停止了活动，才会把会话删除以节省存储空间。
在这里插入图片描述

andyyah晓波

关注

16
点赞
踩
20

收藏

觉得还不错? 一键收藏
0
评论
Python网络爬虫案例实战：爬虫网络概述-会话和 Cookie

在浏览网站的过程中，经常会遇到需要登录的情况，有些页面只有登录后才可以访问，而且登录之后可以连续访问很多次网站，但是有时候过一段时间就需要重新登录。还有些网站，在打开浏览器时就自动登录了，而且很长时间都不会失效，这又是为什么呢？其实涉及会话（Session）和 Cookie的相关知识，下面将揭开它们神秘的面纱。
复制链接

扫一扫

专栏目录