- 博客(2)
- 收藏
- 关注
原创 2021-06-09*RDD编程初级实践
RDD编程初级实践一、数据来源描述pyspark交互式编程科任老师提供分析数据data.txt,该数据集包含了某大学计算机系的成绩,数据格式如下所示:Tom,DataBase,80Tom,Algorithm,50Tom,DataStructure,60Jim,DataBase,90Jim,Algorithm,60Jim,DataStructure,80……编写独立应用程序实现数据去重对于两个输入文件A和B,编写Spark独立应用程序,对两个文件进行合并,并剔除其中重复的内容,得到一个
2021-06-09 17:42:30 1053 4
原创 **调用MapReduce对文件中各个单词出现的次数进行统计**
把本地文件系统的“/home/hadoop/ljk.txt”上传到HDFS中的当前用户目录的input目录下,也就是上传到HDFS的“/user/hadoop/input/”目录下:./bin/hdfs dfs -put /home/hadoop/ljk.txt input可以使用ls命令查看一下文件是否成功上传到HDFS中,具体如下:./bin/hdfs dfs –ls input首先,启动Eclipse直接采用默认的设置“/home/hadoop/workspace”,
2020-12-20 17:35:52 197
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人