使用正则匹配去除重复字段

正则表达式这个语法以简单高效著称,但是有一点i就是比较复杂。

近期有个功能需要去除字符串中重复的部分,由于使用正常的传统的那种舒服拆分成数组在一个一个匹配的方式感觉有点效率过低浪费性能,于是便想到了正则表达式来匹配重复的字符串,并利用String自导的replaceAll方法来将相应的字符串给删除掉。

目标字符串:

"10110,10254,10554,11025,10254,11002,11532,10110,";

这是一个数字数组,但是这里面有某些ID是重复的,我必须将之去除掉。由于我对正则语法实在不熟悉,都是临时对着说明文档在使用的阶段。没有比较好的思路,所以去网上查了些思路。

发现一个类似的解决方案,去除重复的字母具体代码如下:

String str = "aaaaaaahdbkjsdnfkjsndjkfsdfsdf";   
        str = str.replaceAll("(?s)(.)(?=.*\\1)", "");   
        System.out.println(str);
大致看了下说明意思。

(?s) 开启单行模式 DOTALL 让. 号匹配任意字符 
(.) 任意字符 并捕获在第一组 
(?=.*\1) 这是断言, 表示后面内容将是 任意个字符加上第一组所捕获的内容 
 

第一条:开启正则的某些模式,感觉跟我没多少关系,我这是要去除重复的字符串,他这是去字母。

从第二条看过去来看,关键应该是分组,大致是思路我有点印象了,还是说匹配某个字符串,然后添加了个断言,第三条就是那个断言,也就是说将当前字符串做一个分组,放到断言里去了之后,匹配重复的部分。然后我对着将我的需求修改了一下。

String reg = "(\\d{5},)(?=(\\d{5},)*\\1)";

具体代码如下

		String str = "abcdeabcdeabcdeaaaaaadddddceeeeabcccccccacadaeec"; 
		String str1 = "10110,10254,10554,11025,10254,11002,11532,10110,";
		String reg = "(\\d{5},)(?=(\\d{5},)*\\1)";
		str = str.replaceAll("(?s)(.)(?=.*\\1)", ""); 
		str1 = str1.replaceAll(reg, "");
//		str = str.replaceAll(reg, ""); 
		System.out.println(str1); 
一开始是断言里面没有加 * 导致匹配失败,我猜测如果不加的话将会只匹配一组了。

但是后来我发现这个里面有个限制,就是该字符串数组就会被我限制在5个里面,如果其中有某一条字符串超过了5位数,则会导致匹配失败,这可能是个不足,因为我现在在讲6个作为一组,然后一组一组的匹配的,所以才会有这个问题,如果是其他的话,应该就不会有这个问题了。

OK,暂时算是解决问题了。这个断言还是有点不好理解,感觉有点预言性质,但是又不是进入实际的匹配对象里面去,主要是用处大概是对当前是匹配对象做进一步的限制和条件,以增强匹配的正确性。这个可能需要做进一步的测试才能得知。先做到这了,断言还有很多用途(?<=exp)、(?=exp)、(?!exp)、(?<!exp)等多种方式,每一种还会有各种细微的差别,这个先下去研究,等有个靠谱的结论了在说好了。

  • 2
    点赞
  • 2
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
### 回答1: ``` SELECT regexp_replace(trim(column_name),'^(1[3|4|5|7|8][0-9]{9})|(\\+861[3|4|5|7|8][0-9]{9})$') as phone_number FROM table_name; ``` 说明: - `trim(column_name)` 用来去除前后空格。 - `regexp_replace(trim(column_name),'^(1[3|4|5|7|8][0-9]{9})|(\\+861[3|4|5|7|8][0-9]{9})$')` 用来替换匹配到的手机号。正则表达式`^(1[3|4|5|7|8][0-9]{9})|(\\+861[3|4|5|7|8][0-9]{9})$` 匹配11位手机号码或者国内手机号前加+86的手机号码。 - `as phone_number` 用来给查询结果起别名。 - `FROM table_name` 指定查询的表。 注意: - 确保hive 版本支持正则函数 - 更改表名和字段名 - 更改正则表达式根据你的需要。 ### 回答2: 在Hive SQL中,我们可以使用正则表达式函数和字符串函数来实现字段去除空格后匹配手机号的代码。 首先,使用正则表达式函数`regexp_replace`去除字段中的空格,然后使用字符串函数`regexp_extract`提取匹配的手机号。 以下是代码示例: ```sql SELECT col_name FROM table_name WHERE regexp_extract(regexp_replace(col_name, '\\s', ''), '(13[0-9]|14[579]|15[0-35-9]|16[6]|17[0135678]|18[0-9]|19[89])\\d{8}', 0) != ''; ``` 其中,`col_name`代表要匹配的字段名,`table_name`代表表名。 代码中使用了`regexp_replace(col_name, '\\s', '')`去除字段中的所有空格。反斜杠需要使用两个,因为在字符串中需要转义。 然后,将去除空格的结果作为第一个参数传递给`regexp_extract`函数,使用`'(13[0-9]|14[579]|15[0-35-9]|16[6]|17[0135678]|18[0-9]|19[89])\d{8}'`作为正则表达式匹配手机号的模式。 最后,通过判断提取结果是否为空字符串,来筛选出匹配的手机号。 这样,我们就可以通过以上代码在Hive SQL中实现字段去除空格后匹配手机号的操作。

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值