python对Hadoop的hdfs的操作——-pyhdfs或python调用shell文件

python对Hadoop的hdfs的操作——-pyhdfs或python调用shell文件

本人在写基因组里的序列比对算法时,需要用Hadoop加快运算的速度,在java中可以直接调用Hadoop里面API提供的方法对hdfs操作,然而由于本人是用python写的算法,需要借助pyhdfs或python调用shell文件来对hdfs来进行操作。

一、pyhdfs操作hdfs

下面本人都详细介绍pyhdfs的安装过程及所需要的安装包见百度网盘:

链接:http://pan.baidu.com/s/1eRSc2aQ 密码:yeov

其中安装的过程直接照着步骤一步步来就可以了,本人Hadoop是Hadoop-2.5.2。

利用pyhdfs打开hdfs文件的实例:

import pyhdfs

#你的Hadoop的master的IP地址
fs=pyhdfs.HdfsClient(hosts="192.168.79.130")
#打开hdfs中目录的文件,f相当于python打开文件的指针
f=fs.open("/hadoop/Test1/input/result.txt")
#输出该文件的第一行
print f.readline()
#关闭 f
f.close()

运行结果如下:

[aa@master BWA]$ python hdfsPythonTest.py
AGCTTTTCATTCTGACTGCAACGG
  • 2
    点赞
  • 16
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值