HIVE SQL regexp_extract和regexp_replace配合使用正则提取多个符合条件的值

《平凡的世界》评分不错,《巴黎圣母院》改变成的电影不错,还有<<1984>>也蛮好看。

如何使用regexp_extract&regexp_replace函数将以上文本中所有书籍名称都提取出来?

select 	substr(
				regexp_replace(
				regexp_extract(
				regexp_replace(regexp_replace('《平凡的世界》评分不错,《巴黎圣母院》改变成的电影不错,还有<<1984>>也蛮好看。','<<','《'),'>>','》')
				,'(.*》)',1)
				,'.*?(《[^》|^《]+》)',',$1')
			,2) as books
;

代码解析:
step1:两个regexp_replace()依次将<<规整为,将>>规整为
step2:regexp_extract正则提取满足pattern='.*》'时的值,此操作的主要目的为剔除最后一个书名号后的文本内容

select 	
				regexp_extract(
				regexp_replace(regexp_replace('《平凡的世界》评分不错,《巴黎圣母院》改变成的电影不错,还有<<1984>>也蛮好看。','<<','《'),'>>','》')
				,'(.*》)',1)
		
;

此时提取出来的结果为:

《平凡的世界》评分不错,《巴黎圣母院》改变成的电影不错,还有《1984》

step3:regexp_replace将书名号前边的内容替换成

#此处的$1是指第一个小括号中的匹配结果
select 	
				regexp_replace(
				'《平凡的世界》评分不错,《巴黎圣母院》改变成的电影不错,还有《1984》'
				,'.*?(《[^》|^《]+》)',',$1')
;

此时提取出来的结果为:

,《平凡的世界》,《巴黎圣母院》,《1984》

此处需要注意的是:
*1).正则表达式中用了非贪婪匹配.*?,如果使用贪婪匹配.*,最终返回的结果将会是

,《1984》

*2)若省去step2的操作,提取出来的结果不满足条件

select 	
				regexp_replace(
				regexp_replace(regexp_replace('《平凡的世界》评分不错,《巴黎圣母院》改变成的电影不错,还有<<1984>>也蛮好看。','<<','《'),'>>','》')
				,'.*?(《[^》|^《]+》)',',$1')
;

此时提取出来的结果为:

,《平凡的世界》,《巴黎圣母院》,《1984》也蛮好看。

step4:substr截取除第一个逗号之外的其余内容

select substr(',《平凡的世界》,《巴黎圣母院》,《1984》',2)
;

最终提取出来的结果为:

《平凡的世界》,《巴黎圣母院》,《1984》

  • 0
    点赞
  • 4
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
### 回答1: ``` SELECT regexp_replace(trim(column_name),'^(1[3|4|5|7|8][0-9]{9})|(\\+861[3|4|5|7|8][0-9]{9})$') as phone_number FROM table_name; ``` 说明: - `trim(column_name)` 用来去除前后空格。 - `regexp_replace(trim(column_name),'^(1[3|4|5|7|8][0-9]{9})|(\\+861[3|4|5|7|8][0-9]{9})$')` 用来替换匹配到的手机号。正则表达式`^(1[3|4|5|7|8][0-9]{9})|(\\+861[3|4|5|7|8][0-9]{9})$` 匹配11位手机号码或者国内手机号前加+86的手机号码。 - `as phone_number` 用来给查询结果起别名。 - `FROM table_name` 指定查询的表。 注意: - 确保hive 版本支持正则函数 - 更改表名和字段名 - 更改正则表达式根据你的需要。 ### 回答2: 在Hive SQL中,我们可以使用正则表达式函数和字符串函数来实现字段去除空格后匹配手机号的代码。 首先,使用正则表达式函数`regexp_replace`去除字段中的空格,然后使用字符串函数`regexp_extract`提取匹配的手机号。 以下是代码示例: ```sql SELECT col_name FROM table_name WHERE regexp_extract(regexp_replace(col_name, '\\s', ''), '(13[0-9]|14[579]|15[0-35-9]|16[6]|17[0135678]|18[0-9]|19[89])\\d{8}', 0) != ''; ``` 其中,`col_name`代表要匹配的字段名,`table_name`代表表名。 代码中使用了`regexp_replace(col_name, '\\s', '')`去除字段中的所有空格。反斜杠需要使用两个,因为在字符串中需要转义。 然后,将去除空格的结果作为第一个参数传递给`regexp_extract`函数,使用`'(13[0-9]|14[579]|15[0-35-9]|16[6]|17[0135678]|18[0-9]|19[89])\d{8}'`作为正则表达式匹配手机号的模式。 最后,通过判断提取结果是否为空字符串,来筛选出匹配的手机号。 这样,我们就可以通过以上代码在Hive SQL中实现字段去除空格后匹配手机号的操作。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值