Python爬虫笔记——Ajax简介

最新推荐文章于 2024-03-30 22:10:50 发布

Fo*(Bi)

最新推荐文章于 2024-03-30 22:10:50 发布

阅读量294

点赞数

分类专栏：爬虫笔记文章标签： python ajax

本文链接：https://blog.csdn.net/weixin_48615832/article/details/107488786

版权

爬虫笔记专栏收录该内容

37 篇文章 4 订阅

订阅专栏

有时候我们在用requests抓取页面的时候，得到的结果可能和在浏览器中看到的不一样，在浏览器中可以看到正常显示的页面数据，但是使用requests得到的结果并没有。这是因为requests获取的都是原始的HTML文档，而浏览器中的页面则是经过JavaScript处理数据后生成的结果，这些数据的来源有多种，可能是通过ajax加载的，可能是包含在HTML文档中的，也可能是经过JavaScript和特
定算法计算后生成的。
对于第一种情况，数据加载是一种异步加载方式，原始的页面最初不会包含某些数据，原始页面
加载完后，会再向服务器请求某个接口获取数据，然后数据才被处理从而呈现到网页上，这其实就是
发送了一个ajax请求。
从Web发展的趋势来看，这种形式的页面越来越多，网页的原始HTML文档不会包含任何数据，
数据都是通过统一加载后再呈现出来的，这样在We开发上可以做到前后端分离，而且降低服
务器直接渲染页面带来的压力。
所以如果遇到这样的页面，直接requests等库来抓取原始页面，是无法获取到有效数据的，
这时需要分析网页后台接口发送的jax请求，如果可以用requests来模拟Ajax请求，那么就可以
成功抓取了。

Ajax，是利用JavaScript在保证页面不被刷新、页面链接不改变的情况下与服务器交换数据并更新
部分网页的技术。

Ajax作用：
1.发送请求。比如：GET、POST、DELETE等请求
2.解析内容。比如：服务器返回的XML、HTML、JSON等文本
3.渲染网页。比如：使用JavaScript在局部更新、删除页面数据

在这里我们需要使用浏览器的开发者工具分析什么是ajax请求：
打开Chrome，在百度搜索微博并登陆也可以选择不登陆。按F12或者鼠标右键检查(N),
打开开发者工具，选择Network再选择XHR,然后滑动页面到底部，会发现出来很多Type是xhr类型请求，点开其中一个进行查看，请求类型是GET，再点击Preview显示的是JSON字符串，里面包含数据，点开Response这是返回给我们最原始的数据，需要执行相应的渲染方法才会显示到浏览器的页面。