- 博客(2)
- 收藏
- 关注
原创 RDD编程初级实践
RDD编程初级实践实验平台一、 pyspark交互式编程二、 编写独立应用程序实现数据去重三、 编写独立应用程序实现求平均值问题四、总结五、参考资料 实验平台 操作系统:Ubuntu16.04 Spark版本:2.4.0 Python版本:3.4.3 一、 pyspark交互式编程 提供分析数据data.txt,该数据集包含了某大学计算机系的成绩,数据格式如下所示: Tom,DataBase,80 Tom,Algorithm,50 Tom,DataStructure,60 Jim,DataBase,90
2021-06-06 17:51:56 168 1
原创 Mapreduce程序 统计文件中每个单词出现次数
mapreduce程序 统计文件中每个单词出现次数调用MapReduce对文件中各个单词出现次数进行统计一、安装环境二、准备工作1.创建Hadoop账户2.更新 apt3.安装vim4.配置SSH、配置SSH无密码登陆三.安装Java环境1.安装JDK2.验证JDK安装情况3.设置JAVA坏境变量四.安装Hadoop五.Hadoop伪分布式配置1.修改配置文件2.格式化 NameNode3.开启NameNode和DataNode守护进程4.校验安装五.调用MapReduce执行WordCount对单词进行计
2020-12-17 15:07:40 1835 1
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人