134.Spark大型电商项目-用户活跃度分析模块-获取指定时间范围内购买金额最多的10个用户

最新推荐文章于 2023-03-28 07:54:45 发布

zerone-f

最新推荐文章于 2023-03-28 07:54:45 发布

阅读量250

点赞数

分类专栏：大数据 spark SparkSQL 电商用户行为分析文章标签： Spark大型电商项目

本文链接：https://blog.csdn.net/someby/article/details/98796077

版权

大数据同时被 3 个专栏收录

196 篇文章 4 订阅

订阅专栏

spark

175 篇文章 3 订阅

订阅专栏

电商用户行为分析

141 篇文章 4 订阅

订阅专栏

代码

运行结果

本篇文章记录获取指定时间范围内购买金额最多的10个用户，使用SparkSession来分析数据。

代码

UserActiveDegreeAnalyze.scala

package graduation.scala.spark

import org.apache.spark.SparkConf
import org.apache.spark.sql.SparkSession

/**
  * FileName: UserActiveDegreeAnalyze
  * Author:   hadoop
  * Email:    3165845957@qq.com
  * Date:     19-8-4 下午11:31
  * Description:
  *
  * 用户活跃度分析
  *
  * 我们这次项目课程的升级，也跟spark从入门到精通的升级采取同步，采用scala+eclipse的方式来开发
  *
  * 我个人而言，还是觉得应该用java去开发spark作业，因为hadoop是最重要的大数据引擎，hadoop mapreduce、hbase，全都是java
  * 整个公司的编程语言技术栈越简单越好，降低人员的招聘和培养的成本
  *
  * 但是由于市面上，现在大部分的公司，做spark都是采取一种，spark用scala开发，所以开发spark作业也用scala
  * 课程为了跟市场保持同步，后面就随便采取scala来开发了
  *
  */
object UserActiveDegreeAnalyze {

  case class UserActionLog(logId: Long, userId: Long, actionTime: String, actionType: Long, purchaseMoney: Double)
  case class UserActionLogVO(logId: Long, userId: Long, actionValue: Long)
  case class UserActionLogWithPurchaseMoneyVO(logId: Long, userId: Long, purchaseMoney: Double)

  def main(args: Array[String]) {
    // 如果是按照课程之前的模块，或者整套交互式分析系统的架构，应该先从mysql中提取用户指定的参数（java web系统提供界面供用户选择，然后java web系统将参数写入mysql中）
    // 但是这里已经讲了，之前的环境已经没有了，所以本次升级从简
    // 我们就直接定义一个日期范围，来模拟获取了参数
    val startDate = "2019-08-01";
    val endDate = "2019-09-01";

    // 开始写代码
    // spark 2.0具体开发的细节和讲解，全部在从入门到精通中，这里不多说了，直接写代码
    // 要不然如果没有看过从入门到精通的话，就自己去上网查spark 2.0的入门资料
    val conf  = new SparkConf().setAppName("UserActiveDegreeAnalyze").setMaster("local[2]")
    /*val spark = SparkSession
      .builder()
      .appName("UserActiveDegreeAnalyze")
      .master("local")
      .config("spark.sql.warehouse.dir", "D:\\test\\spark\\mall\\spark-warehouse")
      .getOrCreate()*/
    val  spark = SparkSession.builder().config(conf).getOrCreate()
    val sc = spark.sparkContext
    // 导入spark的隐式转换
    import spark.implicits._
    // 导入spark sql的functions
    import org.apache.spark.sql.functions._

    val  dataPath:String ="/home/hadoop/IdeaProjects/BigDataGraduationProject/log/"
    // 获取两份数据集
    val userBaseInfo = spark.read.json(dataPath+"user_base_info.json")
    val userActionLog = spark.read.json(dataPath+"user_action_log.json")

    // 第二个功能：获取指定时间范围内购买金额最多的10个用户
    // 对金额进行处理的函数讲解
    // feature，技术点的讲解：嵌套函数的使用
    //{"logId":5518,"userId":28,"actionTime":"2019-08-05 23:22:39","actionType":1,"purchaseMoney":693.76}
    //{"userId":36,"userName":"userName36","registTime":"2019-08-05 23:22:38"}

    userActionLog
      // 第一步：过滤数据，找到指定时间范围内的数据
        .filter("actionTime >= '" + startDate + "' and actionTime <= '" + endDate + "' and actionType = 1")
      // 第二步：关联对应的用户基本信息数据
        .join(userBaseInfo, userActionLog("userId") === userBaseInfo("userId"))
      // 第三部：进行分组，按照userid和username
        .groupBy(userBaseInfo("userId"), userBaseInfo("username"))
      // 第四步：根据消费金额进行聚合
        .agg(round(sum(userActionLog("purchaseMoney")),2).alias("totalPurchaseMoney"))
      //第五步：根据消费金额降序排序
        .sort($"totalPurchaseMoney".desc)
      //第六步：抽取前10条数据
        .limit(10)
      //第七步：展示数据
        .show()

    sc.stop()
    spark.stop()

  }

}

运行结果

+------+----------+------------------+
|userId|  username|totalPurchaseMoney|
+------+----------+------------------+
|    63|userName63|          113068.4|
|    45|userName45|           92207.2|
|    17|userName17|          89249.75|
|    15|userName15|          86711.31|
|    37|userName37|          86457.96|
|    35|userName35|          82805.67|
|    69|userName69|          78521.37|
|    53|userName53|          63049.14|
|    75|userName75|           61517.7|
|     4| userName4|          60995.07|
+------+----------+------------------+

zerone-f

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
134.Spark大型电商项目-用户活跃度分析模块-获取指定时间范围内购买金额最多的10个用户

目录代码运行结果本篇文章记录获取指定时间范围内购买金额最多的10个用户，使用SparkSession来分析数据。代码UserActiveDegreeAnalyze.scalapackage graduation.scala.sparkimport org.apache.spark.SparkConfimport org.apache.spark.sql.Spar...
复制链接

扫一扫