初识spark

为什么学习spark

  1. 是因为高并发:双十一,春运抢火车票,交通,电信
  2. 这些数据都存储到数据库中
  3. 占用磁盘空间很大
  4. 问题:所有的数据在一台电脑上磁盘存储不下,CPU+内存无法读取大文件

hadoop架构主要处理的是离线数据,并不是实时的。
hive太慢
hbase存储的是非结构化数据(和mysql不一样)
无法处理实时的问题:路况,双十一年会,小米(饥饿营销)

spark擅长于实时计算,Apache Spark是专为大数据处理而设计的快速通用的计算引擎,现在形成一个高速发展应用广泛的生态系统。可用它来完成各种各样的运算,包括SQL查询,文本处理,机器学习等,而在spark出现之前,我们一般需要学习各种各样的引擎来分别处理这些需求

性能特点

  1. 更快的速度,内存计算下,spark比hadoop快100倍
  2. 易用性 Spark提供了80多个高级运算符
  3. 通用性
    Spark提供了大量的库,包括Spark Core,Spark SQL,Spark Streaming,MLlib,GraphX。开发者可以在同一个应用程序无缝组合使用这些库。
  4. 支持多种资源管理器
    Spark支持Hadoop YARN,Apache Mesos,及其自带的独立集群管理器。
  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值