关闭

Jupyter配置Spark开发环境

标签: sparkjupyterkernel
2788人阅读 评论(0) 收藏 举报
分类:


效果图

无图无真相,以下是运行截图,

Jupyter运行界面:
Jupyter运行界面

作业监控界面:
作业监控界面


简介

为Jupyter配置Spark开发环境,可以安装全家桶–Spark KernelToree,也可按需安装相关组件。

考虑到一般人更喜欢一步到位,并且Toree将会代替Spark Kernel,故直接且仅需安装Toree即可,不过下面还是给出了所有的安装方法。


Spark Kernel的安装

参照Spark Kernel支持的语言,安装好Spark Kernel后,其默认可以支持Scala,Python,R,SQL,对应的Spark实现分别是Scala with SparkPython with PySparkR With SparkRSpark SQL

参照上述链接,要切换语言时,只需简单的在语句前面加上%%scala/%%pyspark即可。当然,什么都不加时,默认语言为Scala。

另外,启动Jupyter后,可直接在http://localhost:4040/jobs/监控所有作业。


Spark Kernel(旧的项目)

参照下面的安装步骤进行即可,就是有些繁琐。


Toree(新项目)

根据Spark Kernel的介绍,自从Spark Kernel变成Apache的孵化项目后,其最新仓库已经 迁移到了incubator-toree

安装时,参照Quick Start What is Apache Toree ,仅需两条命令即可完成安装。

pip install toree
jupyter toree install --spark_home=your-spark-home

值得注意的是:

  1. Toree虽然还在孵化中,但已经能完成上述Spark Kernel的全部功能,即可支持PySpark,Spark SQL等。
  2. 该kernel安装在/usr/local/share/jupyter/kernels/apache_toree_scala目录下

Spark组件单独安装

除了安装上面的方法安装Spark的全家桶外,还可以按需对各组件进行安装。


Scala Kernel的安装

参照jupyter-scala安装即可。


PySpark的安装

1
0

查看评论
* 以上用户言论只代表其个人观点,不代表CSDN网站的观点或立场
    个人资料
    • 访问:219396次
    • 积分:3766
    • 等级:
    • 排名:第8522名
    • 原创:148篇
    • 转载:2篇
    • 译文:1篇
    • 评论:26条
    联系方式
    博客专栏
    文章分类
    最新评论