头歌：Spark案例剖析 - 谷歌网页排名引擎PageRank实战

VIP文章空心木偶☜

已于 2024-05-06 11:23:42 修改

阅读量2k

点赞数 41

文章标签： spark 大数据分布式 zookeeper hadoop hive hbase

于 2024-04-30 00:20:59 首次发布

本文链接：https://blog.csdn.net/weixin_62399938/article/details/138296668

版权

第1关：海量数据导入：SparkSQL大数据导入处理

任务描述

工欲善其事必先利其器，大数据分析中最重要的是熟练掌握数据导入工具的使用方法。Spark SQL是Spark自带的数据库，本关你将应用Spark SQL的数据导入工具实现文本数据的导入。其中，graphx-wiki-vertices.txt文件中含有网页及其id数据，graphx-wiki-edges.txt文件中含有网页及其连接网页id数据。

初始化SparkSQL

利用Scala语言使用Spark SQL首先应该导入Spark SQL的相关包，如下例所示：

import org.apache.spark.SparkConf
import org.apache.spark.SparkContext
import org.apache.spark.sql._

也可通过bin/spark-sql命令，通过类似MySQL命令行交互的方式直接访问SparkSQL数据库。

查看使用数据库

在spark-sql中查询使用数据库和基本的关系数据库使用方法类似。

show databases;
use mydatabase；

通过上述命令即可查询现有数据库并使用数据库。

从文本文件中导入数据
CREATE TABLE vertices(ID BigInt,Title String) ROW FORMAT DELIMITED FIELDS TERMINATED BY '\t' LINES TERMINATED BY '\n';
LOAD DATA LOCAL IN PATH 'path/file.txt' INTO TABLE vertices;
上述命令行完成了两样事，创建表vertices并将本地的file.txt导入表中。表中数据按照tab缩进以及换行符进行区分。语句1创建表vertices并创建两个字段ID和Title,其中ID的字段属性为BigInt,Title属性为String。语句二将路径中的file.txt文件导入表中。

利用Scala语言进行数据库操作
val spark = SparkSession.builder.master("local").appName("tester").enableHiveSupport().getOrCreate()
spark.sql("use default")
上述代码通过SparkSession的enableHiveSupport()方法支持Hive数据库的基本使用。通过spark.sql()方法起到对数据库的操作。

编程要求

本关任务主要是利用Spark SQL创建表vertices以及edges，并将本地graphx-wiki-vertices.txt和graphx-wiki-edges.txt两个文件的数据分别导入到表中。

评测说明

评测耗时说明
本实训目前是基于Spark单机模式的运行方式，完成以上评测流程所需时间较长（全过程耗时约118秒），请耐心等待

补全下述代码，使之编译通过。

import org.apache.spark.SparkConf
import org.apache.spark.SparkContext
import org.apache.spark.sql._
object SparkSQLHive {
    def main(args: Array[String]) = {
        val sparkConf = new SparkConf().setAppName("PageRank")
        val sc = new SparkContext(sparkConf)
        val spark = SparkSession.builder.master("local").appName("tester").enableHiveSupport().getOrCreate()
        spark.sql("use default")
        import spark.implicits._
        //drop table if it exists
        spark.sql("DROP TABLE IF EXISTS vertices") 
        spark.sql("DROP TABLE IF EXISTS edges")
        //create table here
        spark.sql("CREATE TABLE IF NOT EXISTS vertices(ID BigInt,Title String)ROW FORMAT DELIMITED FIELDS TERMINATED BY '\t' LINES TERMINATED BY '\n&

最低0.47元/天解锁文章

空心木偶☜

关注

41
点赞
踩
20

收藏

觉得还不错? 一键收藏
打赏
3
评论
头歌：Spark案例剖析 - 谷歌网页排名引擎PageRank实战

下面我们重点介绍Spark SQL的初始化，数据库的使用，外部数据的导入，从而将网页数据导入数据库中方便之后处理。Spark SQL是Spark自带的数据库，本关你将应用Spark SQL的数据导入工具实现文本数据的导入。总的来说，就是预先给一个网页PR值（此处用PR代替PageRank值），由于PR的现实意义是一个网页被访问的概率，一般为1/N,网页的总数为N,并且所有的网页PR总值为1。如果一个PageRank值很高的网页链接到一个其他的网页，那么被链接到的网页的PageRank值会相应地因此而提高。
复制链接

扫一扫