python爬取豆瓣电影并分析_爬取豆瓣电影top250提取电影分类进行数据分析

最新推荐文章于 2024-04-13 01:34:16 发布

weixin_39922868

最新推荐文章于 2024-04-13 01:34:16 发布

阅读量1.6k

点赞数

文章标签： python爬取豆瓣电影并分析

标签（空格分隔）：python爬虫

一、爬取网页，获取需要内容

我们今天要爬取的是豆瓣电影top250

页面如下所示：

1460000006877726

我们需要的是里面的电影分类，通过查看源代码观察可以分析出我们需要的东西。直接进入主题吧！

1460000006877727

知道我们需要的内容在哪里了，接下来就使用我们python强大的request库先获取网页内容下来吧！获取内容后，再使用一个好用的lxml库来分析网页内容，然后获取我们的内容就可以做下一步操作了。

先贴出使用request库和lxml分析的代码

def get_page(i):

url = 'https://movie.douban.com/top250?start={}&filter='.format(i)

html = requests.get(url).content.decode('utf-8') # 使用request库获取网页内容

selector = etree.HTML(html) # 使用lxml库提取内容

'''

通过观察页面就能发现内容在

下的一部分

'''

content = selector.xpath('//div[@class="info"]/div[@class="bd"]/p/text()')

print(content)

for i in content[1::2]:

print(str(i).strip().replace('\n\r', ''))

# print(str(i).split('/'))

i = str(i).split('/')

i = i[len(i) - 1]

key = i.strip().replace('\n', '').split(' ') # 这里的strip和replace的使用目的是去除空格和空行之类

print(key)

通过获取下来的内容我们发现一部电影的各项内容都是用'/'分隔着，我们只需要提取电影分类中的东西，所以我们需要使用

i = str(i).split('/')

来把内容分隔成几项内容，因为电影分类排在最后，所以我们通过

i = i[len(i) - 1]

来获取分隔后的最后一项也就是我们需要的电影分类，还有最后一步我们需要完成的，因为一部电影里面一般都有多个电影分类的标签，所以我们还要继续分隔获取到的电影分类，并且观察可以知道电影分类之间只是用一个空格隔开，所以我们使用下面一行代码就可以分离出各个分类：

key = i.strip().replace('\n',

最低0.47元/天解锁文章

weixin_39922868

关注

0
点赞
踩
4

收藏

觉得还不错? 一键收藏
0
评论
python爬取豆瓣电影并分析_爬取豆瓣电影top250提取电影分类进行数据分析

标签（空格分隔）：python爬虫一、爬取网页，获取需要内容我们今天要爬取的是豆瓣电影top250页面如下所示：我们需要的是里面的电影分类，通过查看源代码观察可以分析出我们需要的东西。直接进入主题吧！知道我们需要的内容在哪里了，接下来就使用我们python强大的request库先获取网页内容下来吧！获取内容后，再使用一个好用的lxml库来分析网页内容，然后获取我们的内容就可以做下一步操作了。先贴出...
复制链接

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。