Spark实现二次排序

最新推荐文章于 2021-06-02 12:24:22 发布

wisgood

最新推荐文章于 2021-06-02 12:24:22 发布

阅读量1.3k

点赞数

分类专栏： spark 文章标签： spark spark排序 spark二次排序

本文链接：https://blog.csdn.net/wisgood/article/details/55667612

版权

spark 专栏收录该内容

65 篇文章 0 订阅

订阅专栏

1、HDFS文件说明

文件为普通的文本文件，无压缩，\001分割，共3列，一次为province_id,city_id,city_uv

需要按照province_id升序，city_uv降序操作

2、代码

var data = sc.textFile("/home/hdfs/test_second")

var rdd1=data.map(_.split("\001")).map(fields=>(fields(0).toInt,s"${fields(1)},${fields(2)}"))
var rdd2 = rdd1.groupByKey.sortByKey()
var rdd3 = rdd2.flatMap(x=>{
var r = x._2.toList.sortWith(_.split(",")(1).toInt>_.split(",")(1).toInt)
for(e <- r) yield s"${x._1},${e}"

}).collect.foreach(println)

结果如下：---------------------------------------------

如果想把province_id按照字符串排序，需要加上，修改默认的数字排序为字符串排序

implicit val sortIntegersByString = new Ordering[Int]{
override def compare(a: Int, b: Int) =

a.toString.compare(b.toString)}

结果

3、使用dataframe实现

var data = sc.textFile("/ home/hdfs//test_second")
case class Element(province_id: Integer, city_id: Integer, uv: Integer)
import org.apache.spark.sql.hive.HiveContext
val hiveContext = new org.apache.spark.sql.hive.HiveContext(sc)
import hiveContext.implicits._
val df = data.map(_.split("\001")).map(x=>Element(x(0).toInt,x(1).toInt,x(2).toInt)).toDF()
df.registerTempTable("element")
hiveContext.sql("select * from element order by province_id desc ,uv desc ").collect().foreach(println)

wisgood

关注

0
点赞
踩
2

收藏

觉得还不错? 一键收藏
0
评论
Spark实现二次排序

1、HDFS文件说明文件为普通的文本文件，无压缩，\001分割，共3列，一次为province_id,city_id,city_uv需要按照province_id升序，city_uv降序操作2、代码var data = sc.textFile("/home/hdfs/test_second")var rdd1=data.map(_.split("\001")).map(fields=&gt;(f...
复制链接

扫一扫

专栏目录