Spark独门秘籍:打造结构一体化、功能多元化的高效数据流水线

- 根据您的了解,目前Spark发展的情况如何? 

目前Spark的发展不错,由于其高速的计算能力,强大的多种功能和一栈式解决方案,因此在美国和中国都有不少的用户群。但是从整体上来看,还是要在降低用户开发和调试成本上花更多的精力。由于Spark是并发异步模型,而且支持内存计算,这样对内存消耗会很大,编程难度较高。一旦出错,如何快速准确的找到错误,并且定位原因,找到最佳的解决方案,对于开发者来说是非常迫切的需求。一旦解决了这个问题,Spark在发展上可以迎来一个新的高峰。

- 请谈谈你在这次大会上即将分享的话题

       我这次演讲主题是基于Spark Graphx的大规模用户图计算和应用。图算法是很多复杂机器学习算法的基础,在单机时代有很多经典的案例,解决了很多问题,尤其是图谱相关的问题,包括关系构建、社区发现、属性传播等等。对于用户群分析和发现,有很重要的作用。在大数据时代,图的规模大到一定程度后,单机就很难解决大规模的图计算了。目前比较成熟的方案有Graphx和GraphLab。我们基于Graphx进行了一些尝试,并解决了生产的问题,当然其中遇到了很多的坑,所以在此和大家分享一下,希望能够让大家少走一些弯路,尽快能够享受基于Graphx的图计算。

- 哪些听众最应该了解这些话题,这个话题可以帮助听众解决哪些问题?

对“用户之间的关系发现”有兴趣和需求的听众,都可以听听这个话题,包括兴趣图谱和关系图谱,以及基于图的推荐。这个话题可以帮助听众在如何用图来思考用户关系有一定的帮助,并且能够了解如何用Graphx进行大规模数据的图算法开发和调试。

更多精彩尽在2014年4月19日中国Spark技术峰会,3月31日前购票订票可享受最低票价优惠。马上报名

往期采访内容:

Spark独门秘籍:打造结构一体化、功能多元化的高效数据流水线

网易王健宗:革命Hadoop,Spark带来百亿市场价值!

尹绪森:打开圈子拥抱变化,谈Spark玩家的自我修养


以“  云计算大数据 推动智慧中国  ”为主题的  第六届中国云计算大会  将于5月20-23日在北京国家会议中心隆重举办。产业观察、技术培训、主题论坛、行业研讨,内容丰富,干货十足。票价优惠,马上  报名  ! 
  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值