Spark 使用sortByKey进行二次排序

最新推荐文章于 2022-07-22 15:37:35 发布

大冰的小屋

最新推荐文章于 2022-07-22 15:37:35 发布

阅读量5.7k

点赞数 1

分类专栏： Spark 文章标签： spark

本文链接：https://blog.csdn.net/dwb1015/article/details/52207945

版权

本文探讨了如何在Spark中使用sortByKey进行自定义二次排序。通过分析sortByKey的源码，了解到要实现这一功能，Key需实现Ordered特质和Serializable接口。提供了Java和Scala两种实现方式的示例。

摘要由CSDN通过智能技术生成

Spark的sortByKey API允许自定义排序规则，这样就可以进行自定义的二次排序、三次排序等等。
先来看一下sortByKey的源码实现：

def sortByKey(): JavaPairRDD[K, V] = sortByKey(true)

def sortByKey(ascending: Boolean): JavaPairRDD[K, V] = {
    val comp = com.google.common.collect.Ordering.natural().asInstanceOf[Comparator[K]]
    sortByKey(comp, ascending)
}

def sortByKey(comp: Comparator[K], ascending: Boolean): JavaPairRDD[K, V] = {
    implicit val ordering = comp // Allow implicit conversion of Comparator to Ordering.
    fromRDD(new OrderedRDDFunctions[K, V, (K, V)](rdd).sortByKey(ascending))
}

class OrderedRDDFunctions[K : Ordering : ClassTag,
                          V: ClassTag,
                          P <: Product2[K, V] : ClassTag] @DeveloperApi() (
    self: RDD[P])
  extends Logging with Serializable

通过代码我们可以发现要实现自定义的二次排序，则Key必须实现Spark 的Ordered特质和Java的Serializable接口。

Java实现：
首先是Key类的自定义实现：

import scala.math.Ordered;

import java.io.Serializable;

/**
 * Key的自定义
 * Created by Administrator on 2016/8/14 0014.
 */
public class SecondarySortKey implements Ordered<SecondarySort>, Serializable {
   
    public int getFirst() {
        return first;
    }

    public int getSecond() {
        return second;
    }

    public void setFirst(int first) {
        this.first = first;
    }

    public void setSecond(int second) {
        this.second = second;
    }

    @Override
    public boolean