微软大数据平台

关键字: 大数据,hadoop,big data,微软大数据

什么是大数据

      身处一个信息爆炸的时代,数据成为企业中不可或缺的重要部分。无论是统计,分析还是预测,企业为了做出决策对数据的依赖性越来越高。从最开始的ERP, CRM系统数据到后来的web2.0电子商务,广告,移动,协作的数据到今时今日wiki,blog,天气图像,文字,影音等等。我们把现在的的数据叫做大数据(big data)。那什么样的数据就被叫做大数据呢?业界现在有个统一的协定,具有4个"V"的属性的数据,我们就称之为大数据。Volume(数据量很大), Variety(数据种类很多), Veracity(数据是真实的), Velocity(数据增长和回馈速度快)。

 

什么是hadoop

      Hadoop 由 Apache Software Foundation 公司于 2005 年秋天作为 Lucene的子项目 Nutch的一部分正式引入。它受到最先由 Google Lab 开发的 Map/Reduce 和 Google File System(GFS) 的启发。2006 年 3 月份,Map/Reduce 和 Nutch Distributed File System (NDFS) 分别被纳入称为 Hadoop 的项目中。 Hadoop 是最受欢迎的在 Internet 上对搜索关键字进行内容分类的工具,但它也可以解决许多要求极大伸缩性的问题。例如,如果您要 grep 一个 10TB 的巨型文件,会出现什么情况?在传统的系统上,这将需要很长的时间。但是 Hadoop 在设计时就考虑到这些问题,采用并行执行机制,因此能大大提高效率。

      Hadoop这个名字不是一个缩写,它是一个虚构的名字。该项目的创建者,Doug Cutting如此解释Hadoop的得名:“这个名字是我孩子给一个棕黄色的大象样子的填充玩具命名的。我的命名标准就是简短,容易发音和拼写,没有太多的意义,并且不会被用于别处。小孩子是这方面的高手。”

 

hadoop的好处

Hadoop 是一个能够对大量数据进行分布式处理的软件框架。但是 Hadoop 是以一种可靠、高效、可伸缩的方式进行处理的。Hadoop 是可靠的,因为它假设计算元素和存储会失败,因此它维护多个工作数据副本,确保能够针对失败的节点重新分布处理。Hadoop 是高效的,因为它以并行的方式工作,通过并行处理加快处理速度。Hadoop 还是可伸缩的,能够处理 PB 级数据。此外,Hadoop 依赖于社区服务器,因此它的成本比较低,任何人都可以使用。

  Hadoop是一个能够让用户轻松架构和使用的分布式计算平台。用户可以轻松地在Hadoop上开发和运行处理海量数据的应用程序。它主要有以下几个优点:

  ⒈高可靠性。Hadoop按位存储和处理数据的能力值得人们信赖。

  ⒉高扩展性。Hadoop是在可用的计算机集簇间分配数据并完成计算任务的,这些集簇可以方便地扩展到数以千计的节点中。

  ⒊高效性。Hadoop能够在节点之间动态地移动数据,并保证各个节点的动态平衡,因此处理速度非常快。

  ⒋高容错性。Hadoop能够自动保存数据的多个副本,并且能够自动将失败的任务重新分配。

 

微软大数据平台

      微软提供一个叫做hadoop on windows的平台,用于和hadoop平台进行一个无缝的连接。基于这个基础上,微软的BI工具可以很轻松的对hadoop数据进行管理,做ETL,设置是做分析模型等等。微软拥有一整套软件和工具来完成大数据的这些行为,
      SQL Server
      SQL Server Azure
      SQL Server 并行数据仓库
      Windows Azure MarketPlace
      Office PowerPivot
      Sharepoint Power View
  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 1
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值