【互动问答分享】第8期决胜云计算大数据时代Spark亚太研究院公益大讲堂

最新推荐文章于 2014-10-31 15:00:38 发布

Spark亚太研究院

最新推荐文章于 2014-10-31 15:00:38 发布

阅读量998

点赞数

分类专栏： spark互动问答文章标签： spark技术 spark教程 spark热点 spark集群云计算

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/wwttz1974/article/details/38727033

版权

spark互动问答专栏收录该内容

13 篇文章 0 订阅

订阅专栏

“决胜云计算大数据时代”

Spark亚太研究院100期公益大讲堂【第8期互动问答分享】

Q1:spark线上用什么版本好？

建议从最低使用的Spark 1.0.0版本，Spark在1.0.0开始核心API已经稳定；

从功能的角度考虑使用最新版本的Spark 1.0.2也是非常好的，Spark 1.0.2在Spark 1.0.1的基础上做了非常多的改进；

Spark 1.0.2改进参考 http://spark.apache.org/releases/spark-release-1-0-2.html

Q2:希望可以细细讲讲推荐系统

推荐系统是机器学习中主要用武之地，Spark亚太研究院决胜大数据时代100期公益大讲堂后续会至少开设三期专题细细讲解；

Q3:用yarn mesos standalone 这几种方式那种用在线上好？spark线上用什么版本好？

如果以前没有部署过其它的大数据集群，集群中的计算框架只有Spark，建议直接使用Standalone，简洁而高效，这样有利于获得最大化的集群执行效率；

如果集群中在运行Spark计算平台的同时还运行了Hadoop的MapReduce、Storm等其它框架，建议使用mesos或者yarn；

在中国建议使用Yarn，因为淘宝已经在生产环境下大规模的使用了Yarn，同时Yarn有非常的中文资料；

Q4:机器学习是不是需要很深的数学功底还是别人实现了能运行跑起来就ok啦？？

Spark的MLLib极大的简化了机器学习库的使用，如果只是简单的使用，不要数学功底，只需要按照官方的示例直接使用即可。

如果进行复制的算法实现，需要数学功底，例如线性代数、统计学等

Q5:还是要深入学习机器学习的那些算法？

从实际应用的角度考虑，最重要的机器学习算法时协同过滤，基于协同过滤的推荐系统在应用系统中有广泛的应用，需要最为第一重点掌握；

分类、聚类、线性回归等也是非常常用而重要的；

Q6:请教下，如果目前应用主要是结构化数据的ORCALE，语言是PLSQL，转换到SPARKSQL是否难度很大，需要完全代码重写呢？

在实际生产环境下，数据和大数据系统是并行存在的，数据库一般直接负责线上交互，大数据系统负责数据分析、实时流处理、交互式查询等；

如果熟练使用PLSQL，可以轻而易举的掌握Spark SQL

SparkSQL的内容可以参考http://edu.51cto.com/lesson/id-33429.html

Spark亚太研究院

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
【互动问答分享】第8期决胜云计算大数据时代Spark亚太研究院公益大讲堂

“决胜云计算大数据时代”Spark亚太研究院100期公益大讲堂【第8期互动问答分享】 Q1:spark线上用什么版本好？建议从最低使用的Spark 1.0.0版本，Spark在1.0.0开始核心API已经稳定；从功能的角度考虑使用最新版本的Spark 1.0.2也是非常好的，Spark 1.0.2在Spark 1.0.1的基础上做了非常多的改进；
复制链接

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。