- 博客(2)
- 收藏
- 关注
原创 spark期末整理复习
DataFrame可以看作是分布式的Row对象的集合,在二维表数据集的每一列都带有名称和类型,这就是Schema元信息,这使得Spark框架可获取更多数据结构信息,从而对在DataFrame背后的数据源以及作用于DataFrame之上数据变换进行针对性的优化,最终达到提升计算效率。
2024-05-12 19:02:06
1085
1
原创 干货丨“看过这篇文章的人都学会Spark了”
Spark是一个用于大规模数据处理的统一计算引擎。Spark是一种快速、通用、可扩展的大数据分析引擎。注意:Spark不仅仅可以做类似于MapReduce的离线数据计算,还可以做实时数据计算,并且它还可以实现类似于Hive的SQL计算,等等,所以说它是一个统一的计算引擎。
2024-03-04 17:38:05
827
3
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人