Spark介绍与安装教程(Linux系统)

Spark介绍与安装教程(Linux系统)

这里写图片描述

Spark的介绍

Hadoop与Strom

Hadoop:

  1. MapReduce:为海量数据提供了计算,但只有Map和Reduce操作,操作不灵活。
  2. HDFS(分布式文件系统):为海量的数据提供了存储。(把全部计算机的存储能力合在一起,数据通过网络在节点之间传输)。
    这里写图片描述
    Strom:一个分布式的、容错的实时计算系统。
    这里写图片描述

大数据处理

  1. 复杂的批量数据处理(batch data processing)
  2. 基于历史数据的交互式查询(interactive query)
  3. 基于实时数据流的数据处理(streaming data processing)

Spark特点与应用场景

  Spark是通用的并行化计算框架,基于MapReduce实现分布式计算,其中间结果可以保存在内存中,从而不再需要读写HDFS。

特点:

  1. 简单方便,使用scala语言。(与RDD很好结合)
  2. 计算速度快,中间结果缓存在内存中。
  3. 高错误容忍。
  4. 操作丰富。
  5. 广播,每个节点可以保留一份小数据集。

核心:RDD(Resilient Distributed Datasets弹性分布式数据集)

应用场景:

  1. 迭代式算法:迭代式机器学习、图算法,包括PageRank、K-means聚类和逻辑回归(logistic regression)。
  2. 交互式数据挖掘工具:用户在同一数据子集上运行多个Adhoc查询。

    框架

  • 13
    点赞
  • 52
    收藏
    觉得还不错? 一键收藏
  • 2
    评论
1. 下载Spark:首先,从Spark官网下载最新版本的Spark。下载完成后,将Spark解压缩到您选择的目录中。 2. 安装Java:Spark需要Java环境才能运行。如果您的系统上没有Java,请先安装Java。 3. 配置环境变量:为了使Spark能够在任何地方运行,您需要将Spark的bin目录添加到系统的PATH环境变量中。在Linux系统上,可以通过编辑~/.bashrc文件来实现这一点。在文件的末尾添加以下行: export PATH=$PATH:/path/to/spark/bin 4. 启动Spark:现在,您可以启动Spark了。在终端中,进入Spark目录并运行以下命令: ./bin/spark-shell 这将启动Spark Shell,您可以在其中运行Spark应用程序。 5. 配置Spark:如果您需要更改Spark的配置,可以编辑Spark的conf目录中的spark-defaults.conf文件。在此文件中,您可以设置Spark的各种配置选项,例如内存分配和日志级别。 6. 运行Spark应用程序:要运行Spark应用程序,您需要编写一个Spark应用程序并将其提交给Spark。您可以使用Scala、Java或Python编写Spark应用程序。在提交应用程序之前,您需要启动Spark的Master节点。在终端中,进入Spark目录并运行以下命令: ./sbin/start-master.sh 然后,您可以使用以下命令提交应用程序: ./bin/spark-submit --class com.example.MyApp /path/to/my/app.jar 这将提交名为MyApp的应用程序,该应用程序位于/app.jar文件中。 7. 监视Spark:您可以使用Spark的Web界面来监视Spark应用程序的运行情况。在浏览器中,输入以下URL: http://localhost:404 这将打开Spark的Web界面,您可以在其中查看Spark应用程序的运行情况、任务进度和日志。

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论 2
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值