大数据毕业设计hadoop+spark+hive微博舆情情感分析 知识图谱微博推荐系统

该博客介绍了使用Selenium爬取微博数据,通过pandas和MapReduce进行数据清洗,然后利用hadoop、hive进行数据存储和分析。进一步,用Spark的Scala进行实时分析,sqoop将统计指标导入mysql。此外,借助Flask和echarts实现可视化,运用机器学习、深度学习(如卷积神经网络KNN、CNN)做推荐,并用springboot+vue.js构建前端后端分离的推荐系统。
摘要由CSDN通过智能技术生成

(一)Selenium自动化Python爬虫工具采集新浪微博评论、热搜、文章等约10万条存入.csv文件作为数据集;

(二)使用pandas+numpy或MapReduce对数据进行数据清洗,生成最终的.csv文件并上传到hdfs;

(三)使用hive数仓技术建表建库,导入.csv数据集;

(四)离线分析采用hive_sql完成,实时分析利用Spark之Scala完成;

(五)统计指标使用sqoop导入mysql数据库;

(六)使用Flask+echarts进行可视化大屏开发;

(七)使用机器学习、深度学习的算法进行个性化微博推荐;

(八)使用卷积神经网络KNN、CNN实现热搜话题流量预测;

(九)搭建springboot+vue.js前后端分离web系统进行个性化推荐界面、话题流量预测界面、知识图谱等实现;

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值