[文本语义相似] 基于bm25算法

最新推荐文章于 2024-08-12 08:56:03 发布

MachineLP

最新推荐文章于 2024-08-12 08:56:03 发布

阅读量1.3k

点赞数 1

分类专栏：文本语义相似计算 NLP 文章标签：机器学习基础

本文链接：https://blog.csdn.net/u014365862/article/details/106182684

版权

NLP 同时被 2 个专栏收录

22 篇文章 4 订阅

订阅专栏

文本语义相似计算

14 篇文章 1 订阅

订阅专栏

文本相似在问答系统中有很重要的应用，如基于知识的问答系统（Knowledge-based QA），基于文档的问答系统（Documen-based QA），以及基于FAQ的问答系统（Community-QA）等。像对于问题的内容，需要进行相似度匹配，从而选择出与问题最接近，同时最合理的答案。本节介绍基于bm25算法。

直接调用rank_bm25：

import jieba
from rank_bm25 import BM25Okapi

corpus = [
    "自然语言处理是计算机科学领域与人工智能领域中的一个重要方向。",
    "它研究能实现人与计算机之间用自然语言进行有效通信的各种理论和方法",
    "自然语言处理是一门融语言学、计算机科学、数学于一体的科学。"
]

tokenized_corpus = [list(jieba.cut(doc)) for doc in corpus]

bm25 = BM25Okapi(tokenized_corpus)


query = "计算机科学领域与人工智能领域中的一个重要方向。"
tokenized_query = list(jieba.cut(query))

doc_scores = bm25.get_scores(tokenized_query)

print ('>>>', doc_scores)

>>> [4.43785513 0.10892205 0.17773669]

python代码如下：

import math
import jieba
from utils import utils

# 测试文本
text = '''
自然语言处理是计算机科学领域与人工智能领域中的一个重要方向。
它研究能实现人与计算机之间用自然语言进行有效通信的各种理论和方法。
自然语言处理是一门融语言学、计算机科学、数学于一体的科学。
因此，这一领域的研究将涉及自然语言，即人们日常使用的语言，
所以它与语言学的研究有着密切的联系，但又有重要的区别。
自然语言处理并不是一般地研究自然语言，
而在于研制能有效地实现自然语言通信的计算机系统，
特别是其中的软件系统。因而它是计算机科学的一部分。
'''

class BM25(object):

    def __init__(self, docs):
        self.D = len(docs)
        self.avgdl = sum([len(doc)+0.0 for doc in docs]) / self.D
        self.docs = docs
        self.f = []  # 列表的每一个元素是一个dict，dict存储着一个文档中每个词的出现次数
        self.df = {} # 存储每个词及出现了该词的文档数量
        self.idf = {} # 存储每个词的idf值
        self.k1 = 1.5
        self.b = 0.75
        self.init()

    def init(self):
        for doc in self.docs:
            tmp = {}
            for word in doc:
                tmp[word] = tmp.get(word, 0) + 1  # 存储每个文档中每个词的出现次数
            self.f.append(tmp)
            for k in tmp.keys():
                self.df[k] = self.df.get(k, 0) + 1
        for k, v in self.df.items():
            self.idf[k] = math.log(self.D-v+0.5)-math.log(v+0.5)

    def sim(self, doc, index):
        score = 0
        for word in doc:
            if word not in self.f[index]:
                continue
            d = len(self.docs[index])
            score += (self.idf[word]*self.f[index][word]*(self.k1+1)
                      / (self.f[index][word]+self.k1*(1-self.b+self.b*d
                                                      / self.avgdl)))
        return score

    def simall(self, doc):
        scores = []
        for index in range(self.D):
            score = self.sim(doc, index)
            scores.append(score)
        return scores

if __name__ == '__main__':
    sents = utils.get_sentences(text)
    doc = []
    for sent in sents:
        words = list(jieba.cut(sent))
        words = utils.filter_stop(words)
        doc.append(words)
    print(doc)
    s = BM25(doc)
    print(s.f)
    print(s.idf)
    print(s.simall(['自然语言', '计算机科学', '领域', '人工智能', '领域']))

分段再分词结果：

[['自然语言', '计算机科学', '领域', '人工智能', '领域', '中', '一个', '方向'], 
['研究', '人', '计算机', '之间', '自然语言', '通信', '理论', '方法'], 
['自然语言', '一门', '融', '语言学', '计算机科学', '数学', '一体', '科学'], 
[],
['这一', '领域', '研究', '涉及', '自然语言'], 
['日常', '语言'], 
['语言学', '研究'], 
['区别'], 
['自然语言', '研究', '自然语言'], 
['在于', '研制', '自然语言', '通信', '计算机系统'], 
['特别', '软件系统'], 
['计算机科学', '一部分']]

s.f

列表的每一个元素是一个dict，dict存储着一个文档中每个词的出现次数

[{'中': 1, '计算机科学': 1, '领域': 2, '一个': 1, '人工智能': 1, '方向': 1, '自然语言': 1}, 
{'之间': 1, '方法': 1, '理论': 1, '通信': 1, '计算机': 1, '人': 1, '研究': 1, '自然语言': 1}, 
{'融': 1, '一门': 1, '一体': 1, '数学': 1, '科学': 1, '计算机科学': 1, '语言学': 1, '自然语言': 1}, 
{}, 
{'领域': 1, '这一': 1, '涉及': 1, '研究': 1, '自然语言': 1}, 
{'日常': 1, '语言': 1}, 
{'语言学': 1, '研究': 1}, 
{'区别': 1}, 
{'研究': 1, '自然语言': 2}, 
{'通信': 1, '计算机系统': 1, '研制': 1, '在于': 1, '自然语言': 1}, 
{'软件系统': 1, '特别': 1}, 
{'一部分': 1, '计算机科学': 1}]

s.df

存储每个词及出现了该词的文档数量

{'在于': 1, '人工智能': 1, '语言': 1, '领域': 2, '融': 1, '日常': 1, '人': 1, '这一': 1, '软件系统': 1, '特别': 1, '数学': 1, '通信': 2, '区别': 1, '之间': 1, '计算机科学': 3, '科学': 1, '一体': 1, '方向': 1, '中': 1, '理论': 1, '计算机': 1, '涉及': 1, '研制': 1, '一门': 1, '研究': 4, '语言学': 2, '计算机系统': 1, '自然语言': 6, '一部分': 1, '一个': 1, '方法': 1}

s.idf
存储每个词的idf值

{'在于': 2.0368819272610397, '一部分': 2.0368819272610397, '一个': 2.0368819272610397, '语言': 2.0368819272610397, '领域': 1.4350845252893225, '融': 2.0368819272610397, '日常': 2.0368819272610397, '人': 2.0368819272610397, '这一': 2.0368819272610397, '软件系统': 2.0368819272610397, '特别': 2.0368819272610397, '数学': 2.0368819272610397, '通信': 1.4350845252893225, '区别': 2.0368819272610397, '之间': 2.0368819272610397, '一门': 2.0368819272610397, '科学': 2.0368819272610397, '一体': 2.0368819272610397, '方向': 2.0368819272610397, '中': 2.0368819272610397, '理论': 2.0368819272610397, '计算机': 2.0368819272610397, '涉及': 2.0368819272610397, '研制': 2.0368819272610397, '计算机科学': 0.9985288301111273, '研究': 0.6359887667199966, '语言学': 1.4350845252893225, '计算机系统': 2.0368819272610397, '自然语言': 0.0, '人工智能': 2.0368819272610397, '方法': 2.0368819272610397}

s.simall(['自然语言', '计算机科学', '领域', '人工智能', '领域'])
['自然语言', '计算机科学', '领域', '人工智能', '领域']与每一句的相似度

[5.0769919814311475, 0.0, 0.6705449078118518, 0, 2.5244316697250033, 0, 0, 0, 0.0, 0.0, 0, 1.2723636062357853]

MachineLP

关注

1
点赞
踩
5

收藏

觉得还不错? 一键收藏
打赏
1
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录