蚂蚁金服实时数据岗位一面面经
1、简单介绍项目
2、sql中实现join 的算法;在mr或者spark中如何实现sort merge join;单partition内如何保证有序?
三种join:outer join/inner join/cross join join算法:sort merge join/hash join/nested loop join
mr join实现: 1)hash join:小表与大表join
经历三步:
确定Build Table以及Probe Table:这个概念比较重要,Build Table使用join key构建Hash Table,而Probe Table使用join key进行探测,探测成功就可以join在一起。通常情况下,小表会作为Build Table,大表作为Probe Table。此事例中item为Build Table,order为Probe Table;
构建Hash Table:依次读取Build Table(item)的数据,对于每一行数据根据join key(item.id)进行hash,hash到对应的Bucket,生成hash table中的一条记录。数据缓存在内存中,如果内存放不下需要dump到外存;
探测:再依次扫描Probe Table(order)的数据,使用相同的hash函数映射Hash Table中的记录,映射成功之后再检查join条件(