使用MinHash和LSH进行大规模文本数据去重

落难Coder

于 2024-08-08 14:14:56 发布

阅读量504

点赞数 14

分类专栏： NLP Python 文章标签： python 数据去重哈希算法

本文链接：https://blog.csdn.net/u014297502/article/details/141025565

版权

去重逻辑实现

数据准备：在内存中准备好需要处理的文本数据集合。
分词处理：对文本数据进行分词。
计算MinHash：对分词结果计算MinHash。
使用LSH进行快速查找：通过LSH快速找到相似的文本集合。
标记重复文本：将找到的重复文本记录或处理。

代码

# pip install datasketch
import jieba
from datasketch import MinHash, MinHashLSH

# 示例数据
documents = [
    "今天天气真好，适合出去玩。",
    "今天天气不错，可以出去玩。",
    "明天有大雨，最好不要外出。",
    "今天天气真好，适合出游。",
    "明天有暴雨，尽量留在家里。"
]

# 初始化jieba分词器
jieba<

最低0.47元/天解锁文章

确定要放弃本次机会？

福利倒计时

: :

立减 ¥

普通VIP年卡可用

立即使用

落难Coder

关注关注

14
点赞
踩
2

收藏

觉得还不错? 一键收藏
打赏
0
评论
使用MinHash和LSH进行大规模文本数据去重

假设我们有一组包含简单中文文本的数据。我们首先对每条文本进行分词，然后计算每条文本的MinHash值，并使用LSH将这些值插入到一个可查询的结构中。最后，我们查询每个文本的MinHash，找出所有相似的文本。这种方法特别适合处理语义上相似的文本，而不仅仅是字面上完全相同的文本。在这个例子中：文档0和文档3非常相似，因为它们都描述了“今天天气好，适合出去玩”的情景，尽管用词略有不同。文档2和文档4虽然都提到了“明天有雨”，但用词和句式的不同可能使得它们的相似度低于阈值。
复制链接

扫一扫