简易数据分析 13 | Web Scraper 抓取二级页面

最新推荐文章于 2024-06-22 11:24:57 发布

卤蛋实验室

最新推荐文章于 2024-06-22 11:24:57 发布

阅读量1.5k

点赞数 1

分类专栏：数据运营数据分析运营文章标签： web scraper 数据分析爬虫 python 爬虫运营

版权声明：本文为博主原创文章，遵循 CC 4.0 BY 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/wsyzxxn9/article/details/102811549

版权

这是简易数据分析系列的第 13 篇文章。

本文首发于博客园：简易数据分析 13。

不知不觉，web scraper 系列教程我已经写了 10 篇了，这 10 篇内容，基本上覆盖了 Web Scraper 大部分功能。今天的内容算这个系列的最后一篇文章了，下一章节我会开一个新坑，说说如何利用 Excel 对收集到的数据做一些格式化的处理和分析。

Web Scraper 教程的全盘总结我放在下一篇文章，今天先开始我们的实战教程。

在前面的课程里，我们抓取的数据都是在同一个层级下的内容，探讨的问题主要是如何应对市面上的各种分页类型，但对于详情页内容数据如何抓取，却一直没有介绍。

比如说我们想抓取 b 站的动画区 TOP 排行榜的数据：

https://www.bilibili.com/ranking/all/1/0/3

按之前的抓取逻辑，我们是把这个榜单上和作品有关的数据抓取一遍，比如说下图里的排名、作品名字、播放量、弹幕数和作者名。

经常逛 B 站的小伙伴也知道，UP 主经常暗示观看视频小伙伴三连操作（点赞+投币+收藏），由此可见，这 3 个数据对视频的排名有一定的影响力，所以这些数据对我们来说也有一定的参考价值。

但遗憾的是，在这个排名列表里，并没有相关数据。这几个数据在视频详情页里，需要我们点击链接进去才能看到：

今天的教程内容，就是教你如何利用 Web Scraper，在抓取一级页面（列表页）的同时，抓取二级页面（详情页）的内容。

##1.创建 SiteMap

首先我们找到要抓取的数据的位置，关键路径我都在下图的红框里标出来了，大家可以对照一下：

然后创建一个相关的 SiteMap，这里我取了个 bilibili_rank 的名字：

2.创建容器的 selector

设置之前我们先观察一下，发现这个网页的排行榜数据是 100 条数据一次性加载完的，没有分页的必要，所以这里的 Type 类型选为 Element 就行。

其他的参数都比较简单，就不细说了（不太懂的可以看我之前的基础教程）这里截个图大家可以做个参考：

3.创建列表页子选择器

这次子选择器要抓取的内容如下，也都比较简单，截个图大家可以参考一下：

排名（num）
作品标题（title）
播放量（play_amount）
弹幕量（danmu_count）
作者：（author）

如果做到这一步，其实已经可以抓到所有已知的列表数据了，但本文的重点是：如何抓取二级页面（详情页）的三连数据？

跟着做了这么多爬虫，可能你已经发现了，Web Scraper 本质是模拟人类的操作以达到抓取数据的目的。

那么我们正常查看二级页面（详情页）是怎么操作的呢？其实就是点击标题链接跳转：

Web Scraper 为我们提供了点击链接跳转的功能，那就是 Type 为 Link 的选择器。

感觉有些抽象？我们对照例子来理解一下。

首先在这个案例里，我们获取了标题的文字，这时的选择器类型为 Text：

当我们要抓取链接时，就要再创建一个选择器，选的元素是一样的，但是 Type 类型为 Link：

创建成功后，我们点击这个 Link 类型的选择器，进入他的内部，再创建相关的选择器，下面我录了个动图，注意看我鼠标强调的导航路由部分，可以很清晰的看出这几个选择器的层级关系：

4.创建详情页子选择器

当你点击链接后就会发现，浏览器会在一个新的 Tab 页打开详情页，但是 Web Scraper 的选择窗口开在列表页，无法跨页面选择想要的数据。

处理这个问题也很简单，你可以复制详情页的链接，拷贝到列表页所在的 Tab 页里，然后回车重新加载，这样就可以在当前页面选择了。

我们在类型为 Link 的选择器内部多创建几个选择器，这里我选择了点赞数、硬币数、收藏数和分享数 4 个数据，这个操作也很简单，这里我就不详细说了。

所有选择器的结构图如下：

最低0.47元/天解锁文章

卤蛋实验室

关注

1
点赞
踩
6

收藏

觉得还不错? 一键收藏
3
评论
简易数据分析 13 | Web Scraper 抓取二级页面

这是简易数据分析系列的第 13 篇文章。本文首发于博客园：简易数据分析 13。不知不觉，web scraper 系列教程我已经写了 10 篇了，这 10 篇内容，基本上覆盖了 Web Scraper 大部分功能。今天的内容算这个系列的最后一篇文章了，下一章节我会开一个新坑，说说如何利用 Excel 对收集到的数据做一些格式化的处理和分析。Web Scraper 教程的全盘总结我放在下一篇文...
复制链接

扫一扫

专栏目录

评论 3

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。