携程ajax,Python爬虫实战之爬取携程评论

一、分析数据源

这里的数据源是指html网页?还是Aajx异步。对于爬虫初学者来说,可能不知道怎么判断,这里辰哥也手把手过一遍。

提示:以下操作均不需要登录(当然登录也可以)

咱们先在浏览器里面搜索携程,然后在携程里面任意搜索一个景点:长隆野生动物世界,这里就以长隆野生动物世界为例,讲解如何去爬取携程评论数据。

96b9b8490d488ed41ad947860dbbd2d4.png

页面下方则是评论数据

4c6056f353246a3c072da5aaffddf08b.png

53a08c5e6ae41dcd00fa785fb827f6c9.png 

e9f462c2f8f7c62bbea65537aefb4b4c.png

从上面两张图可以看出,点击评论下一页,浏览器的链接没有变化,说明数据是Ajax异步请求。因此我们就找到了数据是异步加载过来的,这时候需要去network里面是查看数据包。

二、分析数据包

在network中找到下面这个数据包

d5c53aff557702e04423cab48111e59c.png

查看Preview里面的内容(请求返回内容)

7e7e9e1968d6185195987cd2bad4ef42.png

可以看到数据已经请求到了,下面看一下数据是否是正确的(和网页内容一致)。

c499dce03d944809106b6dd96254ef69.png

ok,没问题之后,下面开始编写Python程序去请求数据。

1.请求地址

1b707ae877f6df971c46a6e138cec0f4.png

可以获取到请求链接和请求方式。

64fafe22d6afe818cd11abae37b1893d.png

这里请求不用添加请求头header也是可以的。其中postUrl是请求链接,data_1是请求参数。

2.请求参数

在network里可以看到请求参数

b03013be14ae413b383b2d0a6415fef9.png

在程序中的构建如下:

fed2f1828a7ade0afbf71403d707248b.png

其中需要关注的是arg中的pageIndex(页数),pageSize(每页条数)。

084068d18ff23deefc3b1c8e7cbc7f24.png

最终结果如下:

11c8c9b3eaa9e86c7ac46b12ec7bf354.png

该景点的评论就可以成功爬取下来了。

三、采集全部评论

上面只是采集了第一页的评论数据,通过改变arg中的pageIndex(页数),就可以遍历爬取全部的评论。

4e9e9fdc99a2b383bbb782ac45705e1f.png

比如这个景点一共是300页。现在把循环给加上

最终的完整代码如下:

ac27f4e42cf7b00cbf0d67b1808f3846.png

到此这篇关于Python爬虫实战之爬取携程评论的文章就介绍到这了,更多相关Python爬取携程评论内容请搜索脚本之家以前的文章或继续浏览下面的相关文章希望大家以后多多支持脚本之家!

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值