Spark SQL案例：分组排行榜

HTTDBGG

于 2022-06-23 17:20:38 发布

阅读量137

点赞数

文章标签：大数据

本文链接：https://blog.csdn.net/lookqinghuaci/article/details/125431216

版权

一、提出任务

分组求TopN是大数据领域常见的需求，主要是根据数据的某一列进行分组，然后将分组后的每一组数据按照指定的列进行排序，最后取每一组的前N行数据。
有一组学生成绩数据

张三 98
李四 87
王五 70
赵六 85
胡八一 68
张三 88
李四 79
王五 85
赵六 77
胡八一 70
张三 89
李四 90
王五 83
赵六 73
胡八一 93
张三 70
李四 75
王五 69
赵六 80
胡八一 79

查看mysql数据表t_score
预备工作：启动集群的HDFS与Spark

在这里插入图片描述

二、完成任务

（一）新建Maven项目

设置项目类型
增加scala目录
（二）添加相关依赖和构建插件
在pom.xml 添加依赖

<?xml version="1.0" encoding="UTF-8"?>
<project xmlns="http://maven.apache.org/POM/4.0.0"
         xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"
         xsi:schemaLocation="http://maven.apache.org/POM/4.0.0 http://maven.apache.org/xsd/maven-4.0.0.xsd">
    <modelVersion>4.0.0</modelVersion>

    <groupId>net.cch.