Hadoop生态圈

什么是Hadoop?

The Apache™ Hadoop® project develops open-source software for reliable, scalable, distributed computing.

 

特点:

  • 扩容能力(Scalable):能可靠地(reliably)存储和处理千兆字节(PB)数据。
  • 成本低(Economical):可以通过普通机器组成的服务器群来分发以及处理数据。这些服务器群总计可达数千个节点。
  • 高效率(Efficient):通过分发数据,hadoop可以在数据所在的节点上并行地(parallel)处理它们,这使得处理非常的快速。
  • 可靠性(Reliable):hadoop能自动地维护数据的多份副本,并且在任务失败后能自动地重新部署(redeploy)计算任务。

主要解决:

  • 海量数据的存储(HDFS)
  • 海量数据的分析(MapReduce)
  • 资源管理调度(YARN)

Hadoop生态系统


 

Hadoop生态圈

 

Hadoop1.0和Hadoop2.0的对比


 

YARN(Yet Another Resource Negotiator,另一种资源协调者)产生背景:

直接源于MRv1在几方面的无能:

1.扩展受限

2.单点故障

3.难以支持MR之外的计算

多框架各自为战,数据共享困难

1.MR离线计算框架

2.Storm实时计算框架

3.Spark内存计算框架

 

 

 

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值