什么是布隆过滤器?
本质上布隆过滤器是一种数据结构,比较巧妙的概率型数据结构(probabilistic data structure),特点是高效地插入和查询,可以用来告诉你 “某样东西一定不存在或者可能存在”。
相比于传统的 List、Set、Map 等数据结构,它更高效、占用空间更少,但是缺点是其返回的结果是概率性的,而不是确切的。
布隆过滤器出现的背景?
假设要判断一个id值是否存在,在不查询数据库的情况下,从一个上亿条数据量的表中得出是否存在该id值的结论。
出现的问题:把所有的id值都缓冲到内存中,然后遍历,但是内存是有限的,太耗内存,实际情况也没有这么打的内存,而且这里只是判断了容量小的id值,要是判断表中某个大字段列,都是不可能在内存中加载成功的。
解决的方案:
1:现在创建一个bit数组数据每项值初始化都是0。
2:此时不再是存储表中每个id值,而是把每个id值通过给定的hash()方法计算后,得到一个bit数组的角标,把这个bit数组角标对应的值修改为1。
3:现在客户端给定一个id值,我们也把这个id值执行hash()方法得到对应的角标,看此角标的值,是否为1,是1表示存在,为0,表示不存在。
4:我们发现一个hash()方法得到角标标识一个唯一id值,不太准确,如果对一个id值,通过多个hash()方法获取的一个角标集合都设置