Bloom Filter的python实现
Bloom Filter
应用场景
快速判断大量数据中某个元素是否属于集合
原理
本质为多个bit map,具体原理请见
Bloom Filter详细介绍以及不同方案对比
代码实现
#!/usr/bin/env python
# -*- coding: UTF-8 -*-
"""
@File :bloom_filter.py
@Author :Aidan Lew
@Date :2022/11/15 11:09
"""
import math
from bitarray import bitarray
class BloomFilter:
"""
实现bloom filter
原理参考:https://zhuanlan.zhihu.com/p/140545941
参数设定:
k: hash函数个数
m: hash table长度(BitArray)
n: 待插入的元素个数
P(true): 当对应位置都是1的时候元素存在的概率(当p大于ln2的时候永远m<n,导致k取整后为1,可知道其极限P(true) = ln2)
最优参数:
m = -n*lnP(true) / ((ln2)^2)
k = m/n*ln2
"""
def __init__(self, input_n, p_true):
self.m = math.ceil(-1 * math.log(p_true, math.e) * input_n / (math.log(2, math.e) ** 2))
self.k = math.ceil(self.m / input_n * math.log(2, math.e))
print(self.k)
print(self.m)
self.tables = bitarray(self.m)
self.tables.setall(0)
def add(self, input_i):
"""
向hash table添加元素
:param input_i:
:return:
"""
for j in range(self.k):
pos = self.get_hash(j, input_i)
self.tables[pos] = 1
def check(self, input_i):
"""
检查是否存在
:param input_i:
:return: res
"""
poses = []
for j in range(self.k):
pos = self.get_hash(j, input_i)
poses.append(pos)
if self.tables[pos] == 0:
return False
print(poses)
return True
def delete(self, input_i):
"""
为了实现删除,本不能bitarray,得计数
但考虑到概率计算结果,碰撞概率小
:param input_i:
:return: res
"""
if self.check(input_i):
for j in range(self.k):
pos = self.get_hash(j, input_i)
self.tables[pos] = 0
return True
return False
def get_hash(self, index, key):
"""
第index个hash函数
:param index:
:param key:
:return: res
"""
SHIFT = (index * 2 + 10) % 5
SIZE = self.m
hashCode = 0
for i in range(len(key)):
hashCode = ((hashCode << SHIFT) + ord(key[i]) + index * index) % SIZE
return hashCode
延申思考
- Bloom Filter在huge language model中可以作为语料的预处理,用于减少体量
- 根据推导出来的最优参数设置,当P(true)设置超过0.618的时候,m就会小于n,从而导致k = 0(向上取整以后是1),是否意味着这个方式处理大规模数据时,check的正确率极限是0.618?