1、HDFS文件说明
文件为普通的文本文件,无压缩,\001分割,共3列,一次为province_id,city_id,city_uv
需要按照province_id升序,city_uv降序操作
2、代码
var data = sc.textFile("/home/hdfs/test_second")
var rdd1=data.map(_.split("\001")).map(fields=>(fields(0).toInt,s"${fields(1)},${fields(2)}"))
var rdd2 = rdd1.groupByKey.sortByKey()
var rdd3 = rdd2.flatMap(x=>{
var r = x._2.toList.sortWith(_.split(",")(1).toInt>_.split(",")(1).toInt)
for(e <- r) yield s"${x._1},${e}"
}).collect.foreach(println)
结果如下:---------------------------------------------
如果想把province_id按照字符串排序,需要加上,修改默认的数字排序为字符串排序
implicit val sortIntegersByString = new Ordering[Int]{
override def compare(a: Int, b: Int) =
a.toString.compare(b.toString)}
结果
3、使用dataframe实现
var data = sc.textFile("/ home/hdfs//test_second")
case class Element(province_id: Integer, city_id: Integer, uv: Integer)
import org.apache.spark.sql.hive.HiveContext
val hiveContext = new org.apache.spark.sql.hive.HiveContext(sc)
import hiveContext.implicits._
val df = data.map(_.split("\001")).map(x=>Element(x(0).toInt,x(1).toInt,x(2).toInt)).toDF()
df.registerTempTable("element")
hiveContext.sql("select * from element order by province_id desc ,uv desc ").collect().foreach(println)