字符串匹配的魔法——KMP算法

1.KMP算法用于解决字符串匹配问题:字符串str1中是否存在某个子串与str2相等。

举个例子:str1=“aabaabaaf” str2="aabaaf",问str1是否存在某个字串与str2相等,如果不存在返回-1,如果存在返回str2在str1中出现的最早位置

先来看暴力解法:

  1. 检查str1的0位置是否是最早位置,将str1从0位置开始的字符与str2从0位置开始的字符进行比较。
  2. 在比较到5位置时,b不等于f,于是宣告0位置匹配失败。进行下一轮匹配
  3. 检查str1的1位置是否是最早位置,将str1从0位置开始的字符与str2从1位置开始的字符进行比较。
  4. 以此类推,直到匹配成功或者匹配失败。

暴力解法的时间复杂度是O(MN),str1长度为M,str2长度为N。很好理解的莽夫思维,也很低效,来看看魔法师会怎么做?

2.如果用KMP算法做,会是什么效果?

  1. 设置两根指针p1,p2,分别置为0,也就是指向str1和str2的首位。
  2. str1[p1] = str2[p2],于是p1++,p2++
  3. 直到p1 = 5,p2 = 5,str1[p1] != str2[p2].
  4. KMP略施魔法,不改变p1,而让p2 = 2,继续匹配,很快就找到了答案。

疑问,KMP怎么知道要让p2 = 2 就可以继续匹配了?

魔法的咒语是最长相等前后缀。别急,我知道你看到这个词可能有点晕,毕竟是魔法咒语嘛。

3.前缀?后缀?相等?最长?

要想理解咒语,就把他先拆开理解,再合并起来。

什么是前缀?拿“阿瓦达索命”来说吧,“阿”、“阿瓦”、“阿瓦达”、“阿瓦达索”都是“阿瓦达索命”的前缀,但是“阿瓦达索命”就不是了,这是完整的咒语。

同理,什么是后缀?“命”、“索命”、“达索命”、“瓦达索命”都是“阿瓦达索命”的后缀。

回来看这个问题,str1和str2在第一轮匹配中对比到5位置时匹配失败了,这说明在0~4位置的字符串是完全相等的吧?也就是str1[0~4] = str2[0~4] = "aabaa"。这个串称为公共子串

那如果存在这样一种情况,就是str1[0~4]中的某个长度为n的后缀和str2[0~4]中的某个长度为n的前缀相等(也就是公共子串长度为n的前后缀相等),将p2指向str2中该前缀紧接着的后一位,也就是n+1位时,就可以保证str1的前n位等于str2的前n位。看看图可能更好理解:

 如图是n=1的情况,str1前字符串中长度为1的后缀“a”和str2前字符串中长度为1的前缀"a"相等,于是让p2指向n+1时,str1[p1]的前1位和str2[p2]的前1位都是“a”,相等吧。

而KMP算法要找的就是最大的那个n,即我们的神奇咒语:最长相等前后缀。列个表格来找找看:

n12345
前缀aaaaabaaba越界
后缀aaabaaabaa越界
是否相等YYNN越界

通过列表格的方式,我们找到了公共子串的最长相等前后缀为“aa”,此时n=2。这样就可以不用改变p1,让匹配继续进行。

为什么这样做可以降低时间复杂度?其实这就相当于将暴力解法中的某些循环跳过了,在暴力解法中str2开头依次与str1的0、1、2、3位置对齐来进行各轮的匹配,而KMP直接将str2的对齐位置跳到了3位置。这样来看时间复杂度肯定降低了吧!

4.例题:力扣28. 实现 strStr()

class Solution {
public:
    int strStr(string haystack, string needle) {
        if(needle.empty() || haystack.empty() ||haystack.size() < needle.size())
            return -1;
        int i = 0 , j = 0;
        int next[needle.size()];

        getNext(next,needle);
        while(i < haystack.size() && j < needle.size())
        {
            if(haystack[i] == needle[j])
            {
                i++;
                j++;
            }else if(next[j] == -1)
            {
                i++;
            }else
            {
                j = next[j];
            }
        }

        return j==needle.size()?i-j:-1;

    }
    void getNext(int next[],string& s)
    {
        if(s.size() == 1)
        {
            next[0] = -1;
            return;
        }
        next[0] = -1;
        next[1] = 0;

        int i = 2,cn = 0;
        
        while(i < s.size())
        {
            if(s[cn] == s[i-1])
                next[i++] = ++cn;
            else if(cn > 0)
                cn = next[cn];
            else
                next[i++] = 0;
        }
        return ;
    }
};

参考:代码随想录登录—专业IT笔试面试备考平台_牛客网

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值