什么是Spark
Spark 是一个用来实现快速而通用的集群计算的平台。
Spark的核心
Spark 的核心是一个对由很多计算任务组成的、运行在多个工作机器或者一个计算集群上的应用 进行调度、分发、监控的计算引擎。
Spark软件栈设计的优点
1)软件栈中所有程序库和高级组件都可以从下层的改进中受益。
2)运行整个软件栈的代价变小了。
3)可以构建出无缝整合处理不同模型的应用。
Spark 的各个组件
Spark的各个组件如图所示:
Spark Core:实现了Spark的基本功能,报包含任务调度,内存管理,错误恢复,与存储系统交互等模块,还包含了对RDD的API定义。
Spark SQL:Spark用来操作结构化数据的程序包。
SparkStreaming:提供了用来操作数据流的API。
MLib与GraghX目前不在学习计划内暂时不介绍。
Spark核心概念简介
每个Spark应用都由一个驱动器程序发起集群上的各种并行操作。驱动器程序通过SparkContext对象访问Spark,这个对象代表对计算集群的一个连接。驱动器程序还要管理多个执行器节点。
下篇文章介绍Spark的RDD编程。