dataframe

谷歌  dataframe趋势图

dataframe不是spark sql提出的

rdd api 提供通用语言api 函数式编程

R/pandas  单机处理



以列的形式构成的分布式数据集(RDD with schema)

dataframe是分布式的关系型数据库一张表

拿到dataframe就相当于拿到一张表

但是做了更多的优化,通过结构化的数据创建,比如文本文件或hive的一张表,其他数据源等,以及RDD

dataframe api可以通过四种语言开发

提供select  select

where  filter

由R语言和pandas概念借鉴而来,从单机小数据演变而来

spark dataframe PB级

传统dataframe GB级


dataframe与RDD对比

RDD分布式并行处理集合

dataframe更像表,知道schema等信息,支持复杂数据结构

提供的API更高,对R,pandas原有人员友好

举例:提供属性的好处,清楚知道有哪些列,查询优化器能做到很好优化,只取一列字段;

总结:

RDD 

java/scala===>jvm

python ===>python runtime


dataframe

java/scala/python ===>logic plan 性能一致


dataframe:

create dataframe

printSchema

show

select

filter


RDD与dataframe互操作:

1.反射 支持两种不同的方式   将rdd转换为dataframe



dataset:

是一个分布式的数据集,新的接口,spark1.6才出现dataset

优点:强类型,支持lambda表达式,支持优化,dataset优于dataframe






  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值