大数据概念复习-HDFS(第一天)

block大小的影响

HDFS中块的大小默认是128M,也可以根据节点的磁盘传输速率进行设置,通过设置dfs.blocksize来实现;
如果设置过大,则可能数据都存在一个节点上,在处理数据时,没法提现出分布式的特点,因为任务只在存有数据的这一个节点上执行,并且处理数据的时间也会变长;
如果设置过小,会占用namenode中的内存,并且寻址时间也会增加。

如何计算出128M

HDFS的寻址时间一般是10ms;
经过前人的大量测试发现,寻址时间为传输时间的1%时,为最佳状态,所以最佳传输时间为10ms/0.01=1000ms=1s,目前磁盘的传输速率普遍为100MB/s;计算出最佳block大小:100MB/s x 1s = 100MB,所以我们设定block大小128MB;实际在生产中,如果磁盘传输速率为200MB/s时,一般设定block大小为256MB,若磁盘传输速率为400MB/s时,一般设定block大小为512MB。

HDFS操作命令

hadoop fs -help
hadoop fs -moveFromLocal:移动本地文件到hdfs上(本地剪切)
hadoop fs -moveToLoacl:剪切hdfs上的文件到本地
hadoop fs -appendToFile:追加数据到hdfs中的一个文件末尾
hadoop fs -tail:查看文件尾部信息
hadoop fs -text:同-cat
hadoop fs -chown:和Linux一样,改变文件所属权限
hadoop fs -getmerge:获取多个文件合并(hadoop fs -getmerge /user/* /sum.log:第一个参数是hdfs目录,可以模糊匹配,第二个参数是本地文件的名称)
hadoop fs -df:统计文件系统的可用空间信息,(hadoop fs -df -h:格式化打印)
hadoop fs -du:统计文件夹或文件的大小
hadoop fs -test:

  1. -d 判断 是否是目录
  2. -e 判断 是否存在
  3. -f 判断 是否是个文件
  4. -s 判断内容是否大于0bytes ,大于0为真
  5. -z 判断内容是否等于0bytes,为0真
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值