【Spark RDD：分组排行榜】

十四是40

已于 2022-06-16 19:10:03 修改

阅读量230

点赞数

文章标签： spark scala big data

于 2022-06-15 10:17:56 首次发布

本文链接：https://blog.csdn.net/qq_56238454/article/details/125289980

版权

文章目录

一、提出任务
二、完成任务

一、提出任务

分组求TopN是大数据领域常见的需求，主要是根据数据的某一列进行分组，然后将分组后的每一组数据按照指定的列进行排序，最后取每一组的前N行数据。
准备一组数据

张益达 85
李炫迈 91
王绿箭 79
张益达 87
李炫迈 90
张益达 89
李炫迈 91
王绿箭 90
李炫迈 95
王绿箭 79
张益达 78
李炫迈 92
李炫迈 85
王绿箭 88
李炫迈 82

在 /home目录下创建 grades.txt 写入上方数据
将 grades.txt 上传到HDFS的 /input目录下
启动HDFS和Spark

二、完成任务

（一）新建Maven项目

在这里插入图片描述

（二）完成项目

修改pom.xml内容

<?xml version="1.0" encoding="UTF-8"?>
<project xmlns="http://maven.apache.org/POM/4.0.0"
         xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"
         xsi:schemaLocation="http://maven.apache.org/POM/4.0.0
         http://maven.apache.org/xsd/maven-4.0.0.xsd">
    <modelVersion>4.0.0</modelVersion>

    <groupId>net.huawei.rdd</groupId>
    <artifactId>GradeTopN</artifactId>
    <version>1.0-SNAPSHOT</version>

    <dependencies>
        <dependency>
            <groupId>org.scala-lang</groupId>
            <artifactId>scala-library</artifactId>