【Spark】Spark一些面试题

204 篇文章 480 订阅 ¥49.90 ¥99.00
本文详细介绍了Spark的核心概念,包括其如何保证宕机恢复、Spark Streaming的工作原理、主要组件以及工作机制。同时,文章讨论了Spark的部署模式、主备切换机制以及与其他框架如Hadoop的对比。此外,还深入探讨了Spark的优化策略,如数据本地性和RDD的特性。最后,分享了Spark的shuffle过程、数据存储格式如Parquet的优势以及与Yarn的整合等知识点。
摘要由CSDN通过智能技术生成

在这里插入图片描述

1.概述

1. spark 如何保证宕机迅速恢复?

适当增加 spark standby master
编写 shell 脚本,定期检测 master 状态,出现宕机后对 master 进行重启操作

2. Spark streaming 以及基本工作原理?

Spark streaming 是 spark core API 的一种扩展,可以用于进行大规模、高吞吐量、容错的实时数据流的处理。
它支持从多种数据源读取数据,比如 Kafka、 Flume、 Twitter 和 TCP Socket,并且能够使用算子比如 map、 reduce、 join 和 window 等来处理数据,处理后的数据可以保存到文件系统、数据库等存储中。

Spark streaming 内部的基本工作原理是:接受实时输入数据流,然后将数据拆分成batch,比如每收集一秒的数据封装成一个 batch,然后将每个 batch 交给 spark 的计算引擎进行处理,最后会生产处一个结果数据流,其中的数据也是一个一个的
batch 组成的。

3. sp

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

九师兄

你的鼓励是我做大写作的动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值