大数据毕业设计hadoop+pyspark图书推荐系统


1.scrapy采集豆瓣图书数据存入sqlite便携式内嵌数据库,从sqlite导出csv文件,使用pandas+numpy/MapReduce数据清洗再次生成清洁的.csv文件;
2.使用hive数仓工具进行建库建表操作并导入.csv文件数据;
3.离线分析采用hive_sql完成,实时计算采用Spark+Scala完成;
4.离线+实时计算的结果指标使用sqoop导入mysql数据库;
5.使用Flask+Echarts搭建可视化大屏展示;
创新点:scrapy分布式爬虫、可视化大屏、离线+实时计算双实现
可以选装如下系统的后台管理系统、推荐系统、预测系统、知识图谱等

  • 2
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 2
    评论
评论 2
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值