1.引言
说到爬网页,我们一般的操作是先查看源代码或者审查元素,找到信息所在节点,然后用 beautifulsoup/xpth/re 来获取数据,这是我们对付静态网页的常用手段。
但大家也知道,现在的网页大多都是动态的了,即数据是通过js渲染加载的,对付静态网页那一套在这根本不讨好,所以,掌握爬取动态加载数据的方法就显得十分必要了。
下面以爬取中国电影网中国票房排行前500为例讲解下获取动态数据的一般步骤。
2.实例与步骤
2.1首先打开数据页面,右键选择审查元素,然后选择Network——>XHR,可以看到,现在里面什么都没有。
2.2然后点击浏览器的刷新按钮或者按F5刷新页面,可以看到,有一条数据出现了,这个链接就是获取数据的页面API,选择Response,可以看到,它是以Json格式返回的数据,我们需要的信息都在里面。
2.3点击页面上的下一页,多获取几条数据,以便找到它们之间的联系。
可以看到,图上的几条数据链接只有最后的页码不同,简直不要太友好!复制一条链接保存,用作代码模拟参考。
2.4知道了数据链接间的关系,我们就可以在代码里面模拟了。比如我们要获取前50页的信息,那就可以这样写。
for i in range(1, 51, 1):
src = 'http://www.cbooo.cn/Mdata/getMdata_movie?area=50&type=0&year=0&initial=%E5%85%A8%E9%83%A8&pIndex=' + str(i)
getHtml(src)
2.5通过以上操作我们得到了返回的数据,但返回的是Json格式的数据,所以我们需要对它进行解析,然后从中得到每部电影的ID(可以发现,每部电影的链接都是这种格式:http://www.cbooo.cn/m/641515,后面的数字是电影的ID,这是我们需要从返回的Json数据里得到的东西。),得到ID后,组成电影链接,之后就是静态页面的操作了。
import requests
import json
def getHtml(src):
html = requests.get(src).content.decode('utf-8')
for con in json.loads(html)['pData']:
url = 'http://www.cbooo.cn/m/' + str(con['ID'])
newhtml = requests.get(url).content.decode('utf-8')
3.总结
获取动态数据的关键是找到“页面获取数据的API”,然后找到这种数据链接间的关系,之后对返回的数据进行解析,从中得到需要的数据。
博主其他文章推荐:
[1] 【python实用特性】- 迭代、可迭代对象、迭代器