hadoop中的Partitioner分区

最新推荐文章于 2021-11-21 12:35:33 发布

Aronlulu

最新推荐文章于 2021-11-21 12:35:33 发布

阅读量380

点赞数

分类专栏： hadoop 文章标签： Hadoop 算法框架

本文链接：https://blog.csdn.net/Aronlulu/article/details/83886949

版权

hadoop 专栏收录该内容

11 篇文章 1 订阅

订阅专栏

hadoop的map/reduce中支持对key进行分区，从而让map出来的数据均匀分布在reduce上，当然，有时候由于机器间配置问题，可能不需要数据均匀，这时候也能派上用场。
框架自带了一个默认的分区类，HashPartitioner，先看看这个类，就知道怎么自定义key分区了。
public class HashPartitioner<K, V> extends Partitioner<K, V> {

/** Use {@link Object#hashCode()} to partition. */
public int getPartition(K key, V value,
int numReduceTasks) {
return (key.hashCode() & Integer.MAX_VALUE) % numReduceTasks;
}

}
很简单，继承Partitioner即可。
先解释一下这个HashPartitioner做的事情
(key.hashCode() & Integer.MAX_VALUE) % numReduceTasks;
将key均匀分布在ReduceTasks上，举例如果Key为Text的话，Text的hashcode方法跟String的基本一致，都是采用的Horner公式计算，得到一个int，string太大的话这个int值可能会溢出变成负数，所以与上Integer.MAX_VALUE（即0111111111111111），然后再对reduce个数取余，这样就可以让key均匀分布在reduce上。
这个简单算法得到的结果可能不均匀，因为key毕竟不会那么线性连续，这时候可以自己写个测试类，计算出最优的hash算法。
PS：hadoop框架本身包含了一些跟hash算法相关的数学之美，比如布隆过滤器（BloomFilter），写好hash函数是关键。