最近邻逼近搜索

最新推荐文章于 2024-10-22 00:45:23 发布

花咪

最新推荐文章于 2024-10-22 00:45:23 发布

阅读量454

点赞数

分类专栏：工程小坑

本文链接：https://blog.csdn.net/cyinfi/article/details/102134979

版权

工程小坑专栏收录该内容

10 篇文章 0 订阅

订阅专栏

说明

由于业务中需要用到向量之间的相似索引，其实向量相思索引在很多的业务场景中都有非常高的应用价值。我们已经有把词、句子、图片、等信息处理成响亮的方法。这样在一些相关性检索方面就有了应用价值。

本文中搭建了annoy和nmslib两种方式。
下面提供了两种方式的的索引构建方式：

annoy索引构建：

f = 200
tc_index = AnnoyIndex(f,metric='angular')
with open(r"D:\sent_vec", "r", encoding="utf-8") as reader:

    for line in reader:

        line = line.strip()
        linespl = line.split()
        id = int(linespl[0])
        vec = [float(v) for v in linespl[1:]]

        tc_index.add_item(id, vec)

tc_index.build(5)

tc_index.save(r'D:\index.ann')

nmslib索引构建：

tc_index = nms.init(method='hnsw', space='cosinesimil')

with open(r"D:\sent_vec", "r", encoding="utf-8") as reader:

    for line in reader:

        line = line.strip()
        linespl = line.split()
        id = int(linespl[0])
        if id % 10000 == 0:
            print("processing {}".format(id))
        vec = [float(v) for v in linespl[1:]]
        if first_data == None:
            first_data = vec

        tc_index.addDataPoint(id, vec)