selenium+phantomjs爬取bilibili

最新推荐文章于 2023-11-07 17:12:15 发布

嗨学编程

最新推荐文章于 2023-11-07 17:12:15 发布

阅读量321

点赞数

分类专栏： Python爬虫文章标签： python

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/fei347795790/article/details/90576840

版权

Python爬虫专栏收录该内容

677 篇文章 327 订阅

订阅专栏

首先我们要下载phantomjs 你可以到 http://phantomjs.org/download.html 这里去下载下载完之后解压到你想要放的位置你需要配置一下环境变量哦

如下图：

首先，我们怎么让浏览器模拟操作，也就是我们自己先分析好整个操作过程，哪个地方有什么问题，把这些问题都提前测试好，没问题了再进行写代码。

打开bilibili网站 https://www.bilibili.com/ 发现下图登陆弹窗

那么这里我们就得先把这个弹窗去除，怎么去呢？你刷新一下或者点一下首页就不会出现了，所以这里我们可以模拟再刷新一次或者点击首页。

接下来搜索关键词蔡徐坤打球这时就涉及到搜索输入框和搜索按钮

点击搜索后我们看到了下列内容，其中圈起来的就是要爬的信息啦这时就涉及到页面源码获取，数据元素定位

那么上面这个过程走完了的话我们也可以选择写入xls格式，同时这里还少了一个事，那就是我现在才爬了一页，那难道不写个自动化爬取全部吗？

那此时就得解决循环获取和写入xls 更重要的事怎么去操作页数和下一页按钮

大致的思路就是这样子了！！！

先导入这些模块

定义一个浏览器对象并设置其他功能

创建excel文件，再创建一张工作表，名为蔡徐坤篮球，并且设置支持覆盖原数据！

打开网站

browser.get('https://www.bilibili.com/')

寻找 “首页” 元素

先判断是否加载输入框再判断搜索按钮是否能点击达到条件后输入内容进行搜索

这时搜索完是弹出新的窗口这时就得获取窗口句柄实现标签页跳转

all_h = browser.window_handles#获取所有窗口句柄browser.switch_to.window(all_h[1])#switch_to.window 标签页跳转

接下来就是获取页面源码了(此处非全部源码)

WAIT.until(EC.presence_of_element_located((By.CSS_SELECTOR,'#server-search-app > div.contain > div.body-contain > div > div.result-wrap.clearfix')))#坚持是否加载完所有搜索结果html = browser.page_source#page_source方法可以获取到页面源码

然后搜索元素并提取内容进行保存

再最后就是循环获取每一页提取数据最后写入xls文件！！！

关注

0
点赞
踩
2

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。