scrapy过滤(redis + bloomfilter)

最新推荐文章于 2024-06-03 10:06:09 发布

_冰澈

最新推荐文章于 2024-06-03 10:06:09 发布

阅读量5.6k

点赞数

本文链接：https://blog.csdn.net/qq_42832858/article/details/97394121

版权

我在pipeline里面添加了如下代码(网上查的)

class SimpleHash(object):
    def __init__(self, cap, seed):
        self.cap = cap
        self.seed = seed

    def hash(self, value):
        ret = 0
        for i in range(len(value)):
            ret += self.seed * ret + ord(value[i])
        return (self.cap - 1) & ret


class BloomFilter(object):
    def __init__(self, host='localhost', port=6379, db=1, blockNum=1, key='bloomfilter'):
        """
        :param host: the host of Redis
        :param port: the port of Redis
        :param db: witch db in Redis
        :param blockNum: one blockNum for about 90,000,000; if you have more strings for filtering, increase it.
        :param key: the key's name in Redis
        """
        self.server = redis.Redis(host=host, port=port, db=db)
        self.bit_size = 1 << 15  # Redis的String类型最大容量为512M，现使用128M 本来是31的话 默认的maxmemory不					够用的 所以被窝改成了15
        self.seeds = [5, 7]
        self.key = key
        self.blockNum = blockNum
        self.hashfunc = []
        for seed in self.seeds:
            self.hashfunc.append(SimpleHash(self.bit_size, seed))

    def isContains(self, str_input):
        if not str_input:
            return False
        m5 = md5()
        m5.update(str_input.encode('utf-8'))
        str_input = m5.hexdigest()
        ret = True
        name = self.key + str(int(str_input[0:2], 16) % self.blockNum)
        for f in self.hashfunc:
            loc = f.hash(str_input)
            ret = ret & self.server.getbit(name, loc)
        return ret

    def insert(self, str_input):
        m5 = md5()
        m5.update(str_input.encode('utf-8'))
        str_input = m5.hexdigest()
        name = self.key + str(int(str_input[0:2], 16) % self.blockNum)
        for f in self.hashfunc:
            loc = f.hash(str_input)
            self.server.setbit(name, loc, 1)

随后我又在spider里面加了这句,就是调用了过滤了

parse_one_url = one_url + url3
                    bf = BloomFilter()
                    if bf.isContains(parse_one_url):
                        pass
                        # print('exist')
                    else:
                        bf.insert(parse_one_url)
                        yield scrapy.Request(parse_one_url, callback=self.parseHtml, dont_filter=False)

_冰澈

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
scrapy过滤(redis + bloomfilter)

我在pipeline里面添加了如下代码(网上查的)class SimpleHash(object): def __init__(self, cap, seed): self.cap = cap self.seed = seed def hash(self, value): ret = 0 for i in rang...
复制链接

扫一扫