计算模型
整个计算过程是:
(1)在map阶段,把所有记录标记成的形式,其中key是id,value则根据来源不同取不同的形式:来源于表A的记录,value的值为"a#"+name;来源于表B的记录,value的值为"b#"+score。
(2)在reduce阶段,先把每个key下的value列表拆分为分别来自表A和表B的两部分,分别放入两个向量中。然后遍历两个向量做笛卡尔积,形成一条条最终结果。
如下图所示:
http://blog.sina.com.cn/s/blog_66474b160101gdop.html
http://blog.csdn.net/leoleocmm/article/details/8602081
https://github.com/julycoding/The-Art-Of-Programming-By-July