Python大作业——爬虫+可视化+数据分析+数据库（爬虫篇）(1)

最新推荐文章于 2024-06-11 16:27:59 发布

2401_84009698

最新推荐文章于 2024-06-11 16:27:59 发布

阅读量504

点赞数 8

分类专栏：程序员文章标签： python 课程设计爬虫

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/2401_84009698/article/details/137486556

版权

接下来通过f12查看页面元素

在这里插入图片描述

我们会发现，查询到的每首歌曲的跳转信息都在一个类名为”tGequ“的a标签里

那么我们就可以使用findAll函数获得所有歌曲的a标签

def search(self, keyword):

self.play_index_now = -1 # 每次重新搜索都将当前播放序号设置为-1

urlbase = r’https://www.8lrc.com/search’ # 搜索的基础地址

params = {‘key’: keyword} # 封装搜索的参数

res_body = requests.get(urlbase, params) # 拼接url，发送请求

soup_body = BeautifulSoup(res_body.text, ‘html.parser’) # html解析获得响应文本

self.tags = soup_body.findAll(class_=‘tGequ’) # 得到查询结果

通过tag[‘href’]即可得到其中的href属性值

由于这是一个相对地址，只要在前面加上baseurl：https://www.8lrc.com即可得到对应歌曲的链接

获取歌曲音频资源及歌词

接着我们访问具体歌曲如https://www.8lrc.com/geci/1130167.htm，希望获得其歌曲的资源以及歌词

同样打开开发者工具，可以发现在第四个script标签中的setPlayer函数里有一个url地址，且其以.mp3为后缀，结合这是一个播放器，我们不难想到这就是歌曲的音频资源，而下面的显然就是我们所需要的歌曲的歌词

知道了这些以后，就可以开始爬虫获取了

首先我们通过soup_body.select("body script")[3].get_text()语句获得这个script标签的文本

通过观察，url地址都是以”url“:"为起始，以引号"作为结束，所以我们不难写出匹配url地址的正则表达式࿱

最低0.47元/天解锁文章

关注

8
点赞
踩
17

收藏

觉得还不错? 一键收藏
0
评论
Python大作业——爬虫+可视化+数据分析+数据库（爬虫篇）(1)

同样打开开发者工具，可以发现在第四个script标签中的setPlayer函数里有一个url地址，且其以.mp3为后缀，结合这是一个播放器，我们不难想到这就是歌曲的音频资源，而下面的显然就是我们所需要的歌曲的歌词。歌词方面同上都是先写出正则表达式，然后匹配得到结果，此处便不再演示，需要注意的是得到的歌词都带着\r\n字符，这显然不是我们所希望的，所以我们。，第一个参数为目标行，第二个参数为起始列，第三个参数为写入的值，从起始列开始写入列表中的值，第四个参数为之前所创建的格式。
复制链接

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。