大数据面试题_payh-2020-02-25

jiayeliDoCn

于 2021-02-26 01:10:16 发布

阅读量188

点赞数

分类专栏：见田日志

本文链接：https://blog.csdn.net/weixin_46661903/article/details/114106715

版权

见田日志专栏收录该内容

8 篇文章 0 订阅

订阅专栏

hive执行流程

解析sql成语法树
生成逻辑计划
优化逻辑计划：数据过滤，mapSaidJoin，谓词下推…
生成物理计划并优化
生成MR/spark程序并执行

dateset datefarmat介绍一下

DataFrame是一种以RDD为基础的分布式数据集，类似于传统数据库中的二维表格。
DataFrame与RDD的主要区别在于，DataFrame带有schema元信息，即DataFrame所表示的二维表数据集的每一列都带有名称和类型。使得Spark SQL得以洞察更多的结构信息，从而对藏于DataFrame背后的数据源以及作用于DataFrame之上的变换进行了针对性的优化，最终达到大幅提升运行时效率的目标。
RDD，由于无从得知所存数据元素的具体内部结构，Spark Core只能在stage层面进行简单、通用的流水线优化。 DataFrame底层是以>RDD为基础的分布式数据集，和RDD的主要区别的是：RDD中没有schema信息，而DataFrame中数据每一行都包含schema
DataFrame = RDD[Row] + shcema

Dataset是一个由特定领域的对象组成强类型（typedrel）集合，可以使用函数（DSL）或关系运算（SQL）进行并行的转换操作。每个Dataset 还有一个称为“DataFrame”的无类型（untypedrel）视图，它是[[Row]]的数据集。
RDD和Dataset的区别
Dataset与RDD类似，但是，它们不使用Java序列化或Kryo，而是使用专用的Encoder编码器来序列化对象以便通过网络进行处理或传输。虽然Encoder编码器和标准序列化都负责将对象转换为字节，但Encoder编码器是动态生成的代码，并使用一种格式，允许Spark执行许多操作，如过滤，排序和散列，而无需将字节反序列化为对象
Dataset和DataFrame的区别与联系
区别：
Dataset是强类型typedrel的，会在编译的时候进行类型检测；而DataFrame是弱类型untypedrel的，在执行的时候进行类型检测；
Dataset是通过Encoder进行序列化，支持动态的生成代码，直接在bytes的层面进行排序，过滤等的操作；而DataFrame是采用可选的java的标准序列化或是kyro进行序列化