用Apache Spark进行大数据处理三

Spark体系架构

Spark体系架构包括如下三个主要组件:

· 数据存储

· API

· 管理框架

接下来让我们详细了解一下这些组件。

数据存储:

SparkHDFS文件系统存储数据。它可用于存储任何兼容于Hadoop的数据源,包括HDFSHBaseCassandra等。

API

利用API,应用开发者可以用标准的API接口创建基于Spark的应用。Spark提供ScalaJavaPython三种程序设计语言的API

下面是三种语言Spark API的网站链接。

· Scala API

· Java

· Python

资源管理:

Spark既可以部署在一个单独的服务器也可以部署在像MesosYARN这样的分布式计算框架之上。

下图2展示了Spark体系架构模型中的各个组件。

 

2 Spark体系架构

弹性分布式数据集

弹性分布式数据集(基于Matei研究论文)或RDDSpark框架中的核心概念。可以将RDD视作数据库中的一张表。其中可以保存任何类型的数据。Spark将数据存储在不同分区上的RDD之中。

RDD可以帮助重新安排计算并优化数据处理过程。

此外,它还具有容错性,因为RDD知道如何重新创建和重新计算数据集。

RDD是不可变的。你可以用变换(Transformation)修改RDD,但是这个变换所返回的是一个全新的RDD,而原有的RDD仍然保持不变。

RDD支持两种类型的操作:

· 变换(Transformation

· 行动(Action

变换:变换的返回值是一个新的RDD集合,而不是单个值。调用一个变换方法,不会有任何求值计算,它只获取一个RDD作为参数,然后返回一个新的RDD

变换函数包括:mapfilterflatMapgroupByKeyreduceByKeyaggregateByKeypipecoalesce

行动:行动操作计算并返回一个新的值。当在一个RDD对象上调用行动函数时,会在这一时刻计算全部的数据处理查询并返回结果值。

行动操作包括:reducecollectcountfirsttakecountByKey以及foreach

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值