python爬虫获取ajax数据_Python爬虫中获取Ajax方式加载数据的方法

本文介绍了如何使用Python爬虫抓取豆瓣电影排行榜,通过分析Ajax请求参数,实现对动态加载JSON数据的获取。重点讲解了如何构造URL、设置headers和formdata,以模拟浏览器行为获取服务器数据。
摘要由CSDN通过智能技术生成

Python爬虫中获取Ajax方式加载数据的方法

发布时间:2020-08-06 10:36:17

来源:亿速云

阅读:99

作者:小新

小编给大家分享一下Python爬虫中获取Ajax方式加载数据的方法,希望大家阅读完这篇文章后大所收获,下面让我们一起去探讨吧!

获取Ajax方式加载的数据

爬虫最需要关注的不是页面信息,而是页面信息的数据来源。

Ajax方式加载的页面,数据来源一定是JSON,直接对AJAX地址进行post或get,拿到JSON,就是拿到了网页数据。

(1)先通过浏览器访问豆瓣电影排行榜

https://movie.douban.com/typerank?type_name=%E5%89%A7%E6%83%85&type=11&interval_id=100:90&action=

152026.png

(2)浏览器访问后,通过抓包工具就可以获取我们想要的一些信息。

152027.png

152028.png

只要response里面有 JSON数据,我们就可以找到服务器的数据来源。

分析发现变动的是start value和limit value, type,interval_id,action,固定不变,这三个url中已经包含了,所以formdata只用传start和limit。import urllib

import urllib2

url = 'https://movie.douban.com/typerank?type_name=%E5%89%A7%E6%83%85&type=11&interval_id=100:90&action='

headers = {'User-Agent':'Mozilla/5.0 (Windows NT 6.1; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko)

Chrome/60.0.3112.101 Safari/537.36'}

# start和limit可以自己随便设置

formdata = {'start':'20','limit':'100'}

data = urllib.urlencode(formdata)

request = urllib2.Request(url,data = data,headers=headers)

response = urllib2.urlopen(request)

print response.read()

看完了这篇文章,相信你对Python爬虫中获取Ajax方式加载数据的方法有了一定的了解,想了解更多相关知识,欢迎关注亿速云行业资讯频道,感谢各位的阅读!

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值