RDD概述

1.1 什么是RDD

        RDD(Resilient Distributed Dataset)叫做分布是数据集,是Spark中最基本的数据抽象,它代表一个不可变、可分区、里面的元素可并行计算的集合。在Spark中,对数据的所有操作不外乎创建RDD、转换(算子)已有的RDD以及调用RDD操作进行求值(执行)。每个RDD都被分为多个分区,这些分区运行在集群中的不同节点上。RDD可以包含Python、java、Scala中任意类型的对象,甚至可以包含用户自定义的对象。甚至可以包含用户自定义法的对象。RDD具有数据流模型的的特点:自动容错。位置感知性调度和可伸缩性。RDD允许用户在指定多个查询时显式地将工作机缓存在内存中,后续的查询后续的查询能够重用工作集,这极大地提升了查询速度。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值