从爬取豆瓣影评到基于朴素贝叶斯的电影评论情感分析(上)

本文介绍了如何爬取豆瓣电影的影评,并使用朴素贝叶斯进行评论的情感分析。首先,通过BeautifulSoup和urllib获取电影评论链接,然后针对每部电影的评论进行爬取。评论分为积极(评分三星以上)和消极(评分二星以下),并据此打标签。接着,对评论内容进行清洗,去除标点符号和特殊字符,最终将数据保存在review.txt文件中,为后续的情感分析做准备。
摘要由CSDN通过智能技术生成

一、爬取豆瓣影评

    基本思路:先获取每个电影的评论区链接,然后依次进入其评论区爬取评论。选取10部电影,每部200条评论。

    用到的包为:BeautifulSoup,urllib

    这里选取的链接为:豆瓣电影,打开后内容如下:

                                 

直接审查元素,找到每部电影的标签位置,如下图:

                                               

因此,找到此标签的代码为:

lists = bsobj.find('ul', {'class': 'lists'}).findAll('li', {'class': 'list-item'})

其中bsobj是该网页的bs对象。

接下来我们需要找到这部电影短评的链接,如下:

评论 3
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值