通过distcp进行并行复制

最新推荐文章于 2024-05-09 12:03:41 发布

weixin_33721427

最新推荐文章于 2024-05-09 12:03:41 发布

阅读量165

点赞数

文章标签：大数据

原文链接：https://my.oschina.net/crxy/blog/387565

版权

为什么80%的码农都做不了架构师？>>>

前面的HDFS访问模型都集中于单线程的访问。例如通过指定文件通配，我们可以对一部分文件进行处理，但是为了高效，对这些文件的并行处理需要新写一个程序。Hadoop有一个叫distcp(分布式复制)的有用程序，能从Hadoop的文件系统并行复制大量数据。

distcp一般用于在两个HDFS集群中传输数据。如果集群在Hadoop的同一版本上运行，就适合使用hdfs方案：

1. % hadoop distcp hdfs://namenode1/foo hdfs://namenode2/bar

这将从第一个集群中复制/foo目录(和它的内容)到第二个集群中的/bar目录下，所以第二个集群会有/bar/foo目录结构。如果/bar不存在，则新建一个。我们可以指定多个源路径，并且所有的都会被复制到目标路径。源路径必须是绝对路径。

默认情况下，distcp会跳过目标路径已经有的文件，但可以通过提供的-overwrite选项进行覆盖。也可以用-update选项来选择只更新那些修改过的文件。

注意：使用-overwrite和-update中任意一个(或两个)选项会改变源路径和目标路径的含义。这可以用一个例子清楚说明。如果改变先前例子中第一个集群的子树/foo下的一个文件，就能通过运行对第二个集群的改变进行同步：

1. % hadoop distcp -update hdfs://namenode1/foo hdfs://namenode2/bar/foo

目标路径需要末尾这个额外的子目录/foo，因为源目录下的内容已被复制到目标目录下。(如果熟悉rsync，你可以想像-overwrite或-update项对源路径而言，如同添加一个隐含的斜杠。)

如果对discp操作不是很确定，最好先对一个小的测试目录树进行尝试。

有很多选项可以控制分布式复制行为，包括预留文件属性，忽略故障和限制复制的文件或总数据的数量。运行时不带任何选项，可以看到使用说明。

distcp是作为一个MapReduce作业执行的，复制工作由集群中并行运行的map来完成。这里并没有reducer。每个文件都由一个单一的map进行复制，并且distcp通过将文件分成大致相等的文件来为每个map数量大致相同的数据。

map的数量是这样确定的。通过让每一个map复制数量合理的数据以最小化任务建立所涉及的开销，是一个很好的想法，所以每个map的副本至少为256 MB。(除非输入的总大小较少，否则一个map就足以操控全局。)例如，1 GB的文件会被分成4个map任务。如果数据很大，为限制带宽和集群的使用而限制映射的数量就变得很有必要。map默认的最大数量是每个集群节点(tasktracker)有20个。例如，复制1000 GB的文件到一个100个节点的集群，会分配2000个map(每个节点20个map)，所以平均每个会复制512 MB。通过对distcp指定-m参数，会减少映射的分配数量。例如，-m 1000会分配1000个map，平均每个复制1 GB。