- 根据您的了解,目前Spark发展的情况如何?
目前Spark的发展不错,由于其高速的计算能力,强大的多种功能和一栈式解决方案,因此在美国和中国都有不少的用户群。但是从整体上来看,还是要在降低用户开发和调试成本上花更多的精力。由于Spark是并发异步模型,而且支持内存计算,这样对内存消耗会很大,编程难度较高。一旦出错,如何快速准确的找到错误,并且定位原因,找到最佳的解决方案,对于开发者来说是非常迫切的需求。一旦解决了这个问题,Spark在发展上可以迎来一个新的高峰。
- 请谈谈你在这次大会上即将分享的话题
我这次演讲主题是基于Spark Graphx的大规模用户图计算和应用。图算法是很多复杂机器学习算法的基础,在单机时代有很多经典的案例,解决了很多问题,尤其是图谱相关的问题,包括关系构建、社区发现、属性传播等等。对于用户群分析和发现,有很重要的作用。在大数据时代,图的规模大到一定程度后,单机就很难解决大规模的图计算了。目前比较成熟的方案有Graphx和GraphLab。我们基于Graphx进行了一些尝试,并解决了生产的问题,当然其中遇到了很多的坑,所以在此和大家分享一下,希望能够让大家少走一些弯路,尽快能够享受基于Graphx的图计算。
- 哪些听众最应该了解这些话题,这个话题可以帮助听众解决哪些问题?
对“用户之间的关系发现”有兴趣和需求的听众,都可以听听这个话题,包括兴趣图谱和关系图谱,以及基于图的推荐。这个话题可以帮助听众在如何用图来思考用户关系有一定的帮助,并且能够了解如何用Graphx进行大规模数据的图算法开发和调试。
更多精彩尽在2014年4月19日中国Spark技术峰会,3月31日前购票订票可享受最低票价优惠。马上报名!
往期采访内容:
Spark独门秘籍:打造结构一体化、功能多元化的高效数据流水线
以“ 云计算大数据 推动智慧中国 ”为主题的 第六届中国云计算大会 将于5月20-23日在北京国家会议中心隆重举办。产业观察、技术培训、主题论坛、行业研讨,内容丰富,干货十足。票价优惠,马上 报名 !