大数据生态与Spark介绍

最新推荐文章于 2021-07-06 13:33:35 发布

gaoshustop

最新推荐文章于 2021-07-06 13:33:35 发布

阅读量141

点赞数

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/gaoshustop/article/details/114260007

版权

大数据生态与Spark介绍

三次信息化浪潮

在这里插入图片描述

一、Spark介绍

Spark是当前热门的大数据处理技术，Spark支持采用Scala、Java、Python和R语言进行编程。

二、主要特点：运行速度快：使用DAG执行引擎以支持循环数据流与内存计算。

容易使用：支持使用Scala、Java、Python和R语言进行编程，可以通过Spark Shell进行交互式编程。
通用性：Spark提供了完整而强大的技术栈，包括SQL查询、流式计算、机器学习和图算法组件。
运行模式多样：可运行于独立的集群模式中，可运行于Hadoop中，也可运行于Amazon EC2等云环境中，并且可以访问HDFS、Cassandra、HBase、Hive等多种数据源。
三、Spark架构图

三、大数据概念：大数据不仅仅是数据的“大量化”，而是包含“快速化”，“多样化”和“价值化”等多重属性。
在这里插入图片描述

数据量大
1.1 ，根据IDC作出的估测，数据一直都在以每年50%的速度增长，也就是说每两年就增长一倍（大数
据摩尔定律）
1.2，人类在最近两年产生的数据量相当于之前产生的全部数据量
1.3，预计到2020年，全球将总共拥有35ZB的数据量，相较于2010年，数据量将增长近30倍
数据类型繁多：大数据是由结构化数据和非结构化数据组成的。（10%的结构化数据，存储在数据库中，–90%的非结构化数据，它们与人类信息密切相关）
处理速度快

从数据的生成到消耗，时间窗口非常小，可用于生成决策的时间非常少
1秒定律：这一点也是和传统的数据挖掘技术有着本质的不同。

价值密度低、商业价值高

三、大数据的影响

全样而非抽样
效率而非精准
相关而非因果

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
大数据生态与Spark介绍

大数据生态与Spark介绍三次信息化浪潮一、Spark介绍Spark是当前热门的大数据处理技术，Spark支持采用Scala、Java、Python和R语言进行编程。二、主要特点：运行速度快：使用DAG执行引擎以支持循环数据流与内存计算。容易使用：支持使用Scala、Java、Python和R语言进行编程，可以通过Spark Shell进行交互式编程。通用性：Spark提供了完整而强大的技术栈，包括SQL查询、流式计算、机器学习和图算法组件。运行模式多样：可运行于独立的集群模式中，可
复制链接

扫一扫

gaoshustop CSDN认证博客专家 CSDN认证企业博客

码龄4年

6: 原创

124万+: 周排名

199万+: 总排名

950: 访问

: 等级

60: 积分

0: 粉丝

0: 获赞

0: 评论

0: 收藏

私信

关注

热门文章

分类专栏

Python 5篇

最新文章

目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。