大数据最新使用Spark探索数据，2024年最新25岁成功入职阿里P7的小哥哥告诉你

最新推荐文章于 2024-07-29 09:10:44 发布

2401_84182222

最新推荐文章于 2024-07-29 09:10:44 发布

阅读量456

点赞数 22

分类专栏：程序员文章标签：大数据面试学习

本文链接：https://blog.csdn.net/2401_84182222/article/details/138735186

版权

程序员专栏收录该内容

144 篇文章 0 订阅

订阅专栏

网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。

需要这份系统化资料的朋友，可以戳这里获取

一个人可以走的很快，但一群人才能走的更远！不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人，都欢迎加入我们的的圈子（技术交流、学习资源、职场吐槽、大厂内推、面试辅导），让我们一起学习成长！

系统实现

了解实验目的

掌握python on Spark的使用理解探索数据的意义和方法，掌握使用Spark探索数据的过程。

1.实验整体流程分析：

准备环境，安装Hadoop和Spark组件
准备数据，采用开源movielens数据集
探索用户数据
探索电影数据
探索电影评级数据

2.准备数据：

打开终端，启动Hadoop和Spark集群

下载相关数据集

上传数据至HDFS

# hadoop fs -mkdir /data
# hadoop fs -ls /
# hadoop fs -put /usr/data/u.user /data/u.user
# hadoop fs -put /usr/data/u.data /data/u.data
# hadoop fs -put /usr/data/u.genre /data/u.genre
# hadoop fs -put /usr/data/u.info /data/u.info
# hadoop fs -put /usr/data/u.item /data/u.item
# hadoop fs -put /usr/data/u.occupation /data/u.occupation
# hadoop fs -ls /data

上传后的HDFS的data目录结构如图所示

3.探索用户数据：

打开终端，执行pyspark命令，进入Spark的python环境

打印首行记录

运行结果如下

分别统计用户、性别和职业的个数

# 以' | '切分每列，返回新的用户RDD
user_fields = user_data.map(lambda line: line.split("|"))
# 统计用户数
num_users = user_fields.map(lambda fields: fields[0]).count()
# 统计性别数
num_genders = user_fields.map(lambda fields: fields[2]).distinct().count()
# 统计职业数
num_occupations = user_fields.map(lambda fields: fields[3]).distinct().count()
# 统计邮编数
num_zipcodes = user_fields.map(lambda fields: fields[4]).distinct().count()
# 返回结果
print ("用户数: %d, 性别数: %d, 职业数: %d, 邮编数: %d" % (num_users, num_genders, num_occupations, num_zipcodes))

运行结果如下

查看年龄分布情况，并用plt.show绘制

查看职业分布情况，同样绘制图

# 并行统计各职业人数的个数，返回职业统计RDD后落地
count_by_occupation = user_fields.map(lambda fields: (fields[3], 1)).reduceByKey(lambda x, y: x + y).collect()
# 生成x/y坐标轴
x_axis1 = np.array([c[0] for c in count_by_occupation])
y_axis1 = np.array([c[1] for c in count_by_occupation])
x_axis = x_axis1[np.argsort(x_axis1)]
y_axis = y_axis1[np.argsort(y_axis1)]
# 生成x轴标签
pos = np.arange(len(x_axis))
width = 1.0
ax = plt.axes()
ax.set_xticks(pos + (width / 2))
ax.set_xticklabels(x_axis)
# 绘制职业人数条状图
plt.xticks(rotation=30)
plt.bar(pos, y_axis, width, color='lightblue')
plt.show()

统计各职业人数

4.探索电影数据：

重新打开终端，执行pyspark命令，进入Spark的python环境

打印首行记录

查看电影的数量

网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。

需要这份系统化资料的朋友，可以戳这里获取

提升。**

需要这份系统化资料的朋友，可以戳这里获取

2401_84182222

关注

22
点赞
踩
18

收藏

觉得还不错? 一键收藏
0
评论
大数据最新使用Spark探索数据，2024年最新25岁成功入职阿里P7的小哥哥告诉你

掌握python on Spark的使用理解探索数据的意义和方法，掌握使用Spark探索数据的过程。上传后的HDFS的data目录结构如图所示。
复制链接

扫一扫