- 博客(2)
- 收藏
- 关注
原创 RDD编程初级实践
RDD编程初级实践pyspark交互式编程编写独立应用程序实现数据去重编写独立应用程序实现求平均值问题pyspark交互式编程问题需求:提供分析数据data.txt,该数据集包含了某大学计算机系的成绩,数据格式如下所示:Tom,DataBase,80Tom,Algorithm,50Tom,DataStructure,60Jim,DataBase,90Jim,Algorithm,60Jim,DataStructure,80……在操作系统:Ubuntu16.04,Spark版本:2.
2021-06-10 19:37:27 410
原创 Eclipse利用Hadoop平台实现统计单词个数
统计单词个数要求1.将待分析的文件(不少于10000英文单词)上传到HDFS2.调用MapReduce对文件中各个单词出现的次数进行统计3.将统计结果下载本地。过程1.首先启动hadoop,用jps判断是否启动成功,如果成功,则如下图所示2.递归创建/user/hadoop/input目录,将不少于10000字单词的文件上传到/user/hadoop/input目录下3.打开eclipse进行配置,填写工作空间4.选择 Window 菜单下的 Preference5.切换 Map/R
2020-12-20 22:00:41 1949
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人