elephant-bird介绍

elephant-bird介绍

    国内基于elephant-bird的资料还太少,除了淘宝搜索技术博客上的一篇网址:

http://www.searchtb.com/2010/09/pb-lzo-used-in-hadoop.html,基本就没有了。但这篇也只是介绍如何使用.

   其实对于elephant-bird的说明在其Readme.md已经很详细了.网址:https://github.com/kevinweil/elephant-bird.我这里就不充当翻译工作.从我自身的理解来大概介绍下.

  相信玩Hadoop的不少同学,肯定少不了要接触hadoop lzo,protocol buffer,thrift这三个东西.比如你使用protocol buffer的code gen生成一个Java对象,如其官网的AddressBook.如果你也想在hadoop中也使用这个类,那该怎么办?

    没有elephant-bird的话,你可能需要针对AddressBook这种结构,自己手动实现Hadoop org.apache.hadoop.io.WritableComparable,以及InputFormat和OutputFormat.这其中工作量很大.可能还需要lzo压缩.那工作量又大了点.但elephant-bird很好的替代了这方面的工作.它能基于protocol buffer的protoc文件,以及thrift的thrift文件,如刚才的AddressBook.生成对应的Writable,InputFormat以及OutputFormat.需要lzo压缩以及64

位编码也没关系,照样都支持.如此省去了你自己去写这些代码的麻烦,而且写这些代码都是机械性的,模板的.所以也就有elephant-bird的存在性.

       但elephant-bird远不只是这些功能,它还支持以下,前提是基于protoc和thrift:      

       1)自动生成Pig的LoadFunc 

       2)自动生成Hive的SerDe 

       3)自动生成HBase的miscellanea     

   

    以上举个例子来说,还是以AddressBook为例,elephant-bird能自动帮你生成Pig中需要读取AddressBook的LoadFunc,Hive中的SerDe等.

    以上是大概介绍.希望能让你明白elephant-bird是干什么的,为什么需要它?最后

说下elephant-bird的版本兼容性.

       1)Protocol Buffer 2.3

       2)Pig 0.8/0.9 (不支持0.7及更低版本)

       3)Hive 0.7

       4)thrift 0.5

       5)Mahout 0.6

       6)Cascading2

以上文章转自:http://guoyunsky.iteye.com/blog/1780150
  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值