基础算法四：编辑距离和文本相似度计算

最新推荐文章于 2023-03-24 11:28:30 发布

小飞鱼_bigdata

最新推荐文章于 2023-03-24 11:28:30 发布

阅读量1.5k

点赞数

分类专栏：算法 python NLP 文章标签：基础算法编辑距离文本相似度自然语言处理动态规划

本文链接：https://blog.csdn.net/zryowen123/article/details/88630193

版权

python 同时被 3 个专栏收录

14 篇文章 1 订阅

订阅专栏

算法

12 篇文章 0 订阅

订阅专栏

NLP

1 篇文章 0 订阅

订阅专栏

编辑距离是对两个字符串差异化的量化，其含义是将一个字符串转化为另一个字符串所需的最少操作次数，允许的编辑操作包括将一个字符替换为另一个字符，插入一个字符，删除一个字符。编辑距离可用在自然语言处理中，用于计算两个文本之间的相似度。

算法的基本原理：对于字符串a[1:i]和字符串b[1:j]来说，用edit[i][j]表示它们间的编辑距离。

如果a[i]和b[j]相同，则edit[i][j]=edit[i-1][j-1]。

如果a[i]和b[j]不相同，则有如下情况：

1) a[1:i]经过多次操作转化为b[1:j-1]，然后再在结尾插入字符b[j]即可，edit[i][j]=edit[i][j-1]+1；

2）a[1:i-1]经过多次操作转化为b[1:j]，然后再将字符a[i]删除即可，edit[i][j]=edit[i-1][j]+1；

3）a[1:i-1]经过多次操作转化为b[1:j-1]，然后再将字符a[i]替换为b[j]即可，edit[i][j]=edit[i-1][j-1]+1。

在这三种情况中取最小值即可。其中edit[0][j]表示将空串转为b[1:j]的操作次数，为j；edit[i][0]表示将a[1:i]转为空串的操作次数，为i。

核心思想：看到这里，应该明白了这是一个动态规划（dynamic programming）问题。动态规划是一种通过求子问题的最优解，从而求得原问题的最优解的方法。其中子问题称为状态，由子问题推出原问题的解称为状态转移方程。这是动态规划算法的核心。

在本问题中，状态定义为求edit[i][j]这样一个二维数组，而上述的多个求解edit[i][j]的公式则为状态转移方程。

该问题的动态规划方程可表示如下：

相似度计算：求出两个字符串a,b间的编辑距离edit(a,b)后，字符串a和字符串b的相似即可这样计算：

$similarity=(max(a,b)-edit(a,b))/max(a,b)$

代码实现：

class LevenshteinDistance(object):

    def distance(self, a, b):
        """
        计算字符串a和b之间的编辑距离
        """
        edit = [[0 for j in range(len(b) + 1)] for i in range(len(a) + 1)]
        for i in range(len(a)):
            edit[i + 1][0] = i + 1
        for j in range(len(b)):
            edit[0][j + 1] = j + 1

        for i in range(len(a) + 1)[1:]:
            for j in range(len(b) + 1)[1:]:
                flag = b[j - 1] == a[i - 1]
                num = 0 if flag else 1
                edit[i][j] = min(edit[i - 1][j] + 1, edit[i][j - 1] + 1, edit[i - 1][j - 1] + num)

        return edit[-1][-1]

    def similarity(self, a, b):
        """
        计算字符串a和b之间的相似度
        """
        m = max(len(a), len(b))
        d = self.distance(a, b)
        return (m - d) / m

测试用例：

if __name__ == '__main__':
    edit = LevenshteinDistance()
    print(edit.distance('kitten', 'sitting'))
    print(edit.similarity('kitten', 'sitting'))


结果为：
3
0.5714285714285714

小飞鱼_bigdata

关注

0
点赞
踩
5

收藏

觉得还不错? 一键收藏
0
评论
基础算法四：编辑距离和文本相似度计算

编辑距离是对两个字符串差异化的量化，其含义是将一个字符串转化为另一个字符串所需的最少操作次数，允许的编辑操作包括将一个字符替换为另一个字符，插入一个字符，删除一个字符。编辑距离可用在自然语言处理中，用于计算两个文本之间的相似度。算法的基本原理：对于字符串a[1:i]和字符串b[1:j]来说，用edit[i][j]表示它们间的编辑距离。如果a[i]和b[j]相同，则edit[i][j]=ed...
复制链接

扫一扫