- 博客(2)
- 收藏
- 关注
原创 2021-06-10
RDD编程实践RDD编程实践1、需求描述Spark 的核心是建立在统一的抽象弹性分布式数据集(Resiliennt Distributed Datasets,RDD)之上的,这使得 Spark 的各个组件可以无缝地进行集成,能够在同一个应用程序中完成大数据处理。RDD 是 Spark 提供的最重要的抽象概念,它是一种有容错机制的特殊数据集合,可以分布在集群的结点上,以函数式操作集合的方式进行各种并行操作。通俗点来讲,可以将 RDD 理解为一个分布式对象集合,本质上是一个只读的分区记录集合。每个 R
2021-06-10 15:00:13 153
原创 调用MapReduce对文件中各个单词出现次数进行统计
实验配置:系统:Ubuntu Kylin | 环境:Hadoop | 软件:Eclipse
2020-12-22 22:22:19 219
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人