Spark入门之基础知识(一)

什么是Spark

Spark 是一个用来实现快速而通用的集群计算的平台。

Spark的核心

Spark 的核心是一个对由很多计算任务组成的、运行在多个工作机器或者一个计算集群上的应用 进行调度、分发、监控的计算引擎。

Spark软件栈设计的优点

1)软件栈中所有程序库和高级组件都可以从下层的改进中受益。
2)运行整个软件栈的代价变小了。
3)可以构建出无缝整合处理不同模型的应用。

Spark 的各个组件

Spark的各个组件如图所示:
在这里插入图片描述
Spark Core:实现了Spark的基本功能,报包含任务调度,内存管理,错误恢复,与存储系统交互等模块,还包含了对RDD的API定义。

Spark SQL:Spark用来操作结构化数据的程序包。

SparkStreaming:提供了用来操作数据流的API。

MLib与GraghX目前不在学习计划内暂时不介绍。

Spark核心概念简介

每个Spark应用都由一个驱动器程序发起集群上的各种并行操作。驱动器程序通过SparkContext对象访问Spark,这个对象代表对计算集群的一个连接。驱动器程序还要管理多个执行器节点。
在这里插入图片描述
下篇文章介绍Spark的RDD编程。

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值