Spark独门秘籍：打造结构一体化、功能多元化的高效数据流水线

最新推荐文章于 2022-04-07 18:45:20 发布

jtjy

最新推荐文章于 2022-04-07 18:45:20 发布

阅读量472

点赞数

本文链接：https://blog.csdn.net/u014429662/article/details/22490271

版权

- 根据您的了解，目前Spark发展的情况如何？

目前Spark的发展不错，由于其高速的计算能力，强大的多种功能和一栈式解决方案，因此在美国和中国都有不少的用户群。但是从整体上来看，还是要在降低用户开发和调试成本上花更多的精力。由于Spark是并发异步模型，而且支持内存计算，这样对内存消耗会很大，编程难度较高。一旦出错，如何快速准确的找到错误，并且定位原因，找到最佳的解决方案，对于开发者来说是非常迫切的需求。一旦解决了这个问题，Spark在发展上可以迎来一个新的高峰。

- 请谈谈你在这次大会上即将分享的话题

我这次演讲主题是基于Spark Graphx的大规模用户图计算和应用。图算法是很多复杂机器学习算法的基础，在单机时代有很多经典的案例，解决了很多问题，尤其是图谱相关的问题，包括关系构建、社区发现、属性传播等等。对于用户群分析和发现，有很重要的作用。在大数据时代，图的规模大到一定程度后，单机就很难解决大规模的图计算了。目前比较成熟的方案有Graphx和GraphLab。我们基于Graphx进行了一些尝试，并解决了生产的问题，当然其中遇到了很多的坑，所以在此和大家分享一下，希望能够让大家少走一些弯路，尽快能够享受基于Graphx的图计算。

- 哪些听众最应该了解这些话题，这个话题可以帮助听众解决哪些问题？

对“用户之间的关系发现”有兴趣和需求的听众，都可以听听这个话题，包括兴趣图谱和关系图谱，以及基于图的推荐。这个话题可以帮助听众在如何用图来思考用户关系有一定的帮助，并且能够了解如何用Graphx进行大规模数据的图算法开发和调试。

更多精彩尽在2014年4月19日中国Spark技术峰会，3月31日前购票订票可享受最低票价优惠。马上报名！

往期采访内容：

Spark独门秘籍：打造结构一体化、功能多元化的高效数据流水线

网易王健宗：革命Hadoop，Spark带来百亿市场价值！

尹绪森：打开圈子拥抱变化，谈Spark玩家的自我修养

以“ 云计算大数据推动智慧中国 ”为主题的 第六届中国云计算大会 将于5月20-23日在北京国家会议中心隆重举办。产业观察、技术培训、主题论坛、行业研讨，内容丰富，干货十足。票价优惠，马上报名！

jtjy

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
Spark独门秘籍：打造结构一体化、功能多元化的高效数据流水线

- 根据您的了解，目前Spark发展的情况如何？目前Spark的发展不错，由于其高速的计算能力，强大的多种功能和一栈式解决方案，因此在美国和中国都有不少的用户群。但是从整体上来看，还是要在降低用户开发和调试成本上花更多的精力。由于Spark是并发异步模型，而且支持内存计算，这样对内存消耗会很大，编程难度较高。一旦出错，如何快速准确的找到错误，并且定位原因，找到最佳的解决方案，对于开发者来
复制链接

扫一扫