Bloom Filter的python实现

Bloom Filter

应用场景

快速判断大量数据中某个元素是否属于集合

原理

本质为多个bit map,具体原理请见
Bloom Filter详细介绍以及不同方案对比

代码实现

#!/usr/bin/env python
# -*- coding: UTF-8 -*-
"""
@File    :bloom_filter.py
@Author  :Aidan Lew
@Date    :2022/11/15 11:09
"""
import math
from bitarray import bitarray


class BloomFilter:
    """
        实现bloom filter
        原理参考:https://zhuanlan.zhihu.com/p/140545941
        参数设定:
            k: hash函数个数
            m: hash table长度(BitArray)
            n: 待插入的元素个数
            P(true): 当对应位置都是1的时候元素存在的概率(当p大于ln2的时候永远m<n,导致k取整后为1,可知道其极限P(true) = ln2)
        最优参数:
            m = -n*lnP(true) / ((ln2)^2)
            k = m/n*ln2
    """

    def __init__(self, input_n, p_true):
        self.m = math.ceil(-1 * math.log(p_true, math.e) * input_n / (math.log(2, math.e) ** 2))
        self.k = math.ceil(self.m / input_n * math.log(2, math.e))
        print(self.k)
        print(self.m)
        self.tables = bitarray(self.m)
        self.tables.setall(0)

    def add(self, input_i):
	    """
	    向hash table添加元素
	    :param input_i:
        :return:
	    """
        for j in range(self.k):
            pos = self.get_hash(j, input_i)
            self.tables[pos] = 1

    def check(self, input_i):
        """
        检查是否存在
        :param input_i:
        :return: res
        """
        poses = []
        for j in range(self.k):
            pos = self.get_hash(j, input_i)
            poses.append(pos)
            if self.tables[pos] == 0:
                return False

        print(poses)
        return True

    def delete(self, input_i):
        """
        为了实现删除,本不能bitarray,得计数
        但考虑到概率计算结果,碰撞概率小
        :param input_i:
        :return: res
        """
        if self.check(input_i):
            for j in range(self.k):
                pos = self.get_hash(j, input_i)
                self.tables[pos] = 0
            return True
        return False

    def get_hash(self, index, key):
        """
        第index个hash函数
        :param index:
        :param key:
        :return: res
        """
        SHIFT = (index * 2 + 10) % 5
        SIZE = self.m
        hashCode = 0
        for i in range(len(key)):
            hashCode = ((hashCode << SHIFT) + ord(key[i]) + index * index) % SIZE
        return hashCode

延申思考

  1. Bloom Filter在huge language model中可以作为语料的预处理,用于减少体量
  2. 根据推导出来的最优参数设置,当P(true)设置超过0.618的时候,m就会小于n,从而导致k = 0(向上取整以后是1),是否意味着这个方式处理大规模数据时,check的正确率极限是0.618?
  • 2
    点赞
  • 1
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值