Python正则匹配一招完整去除文本中的各类表情符号

ASS-ASH

于 2021-12-22 10:42:11 发布

阅读量7.7k

点赞数 8

分类专栏： Python语法处理文本数据文章标签： python 开发语言后端

本文链接：https://blog.csdn.net/qq_38563206/article/details/122079760

版权

我们的文本数据中经常会带有很多表情，如何完整地清除得到高质量的文本供我们利用呢？

以“光荣啊，中国共青团🙌🏻💗🚩”为例进行演示：

def clean(desstr,restr=''):  
    #过滤表情   
    try:  
        co = re.compile(u'['u'\U0001F300-\U0001F64F' u'\U0001F680-\U0001F6FF'u'\u2600-\u2B55]+')  
    except re.error:  
        co = re.compile(u'('u'\ud83c[\udf00-\udfff]|'u'\ud83d[\udc00-\ude4f\ude80-\udeff]|'u'[\u2600-\u2B55])+')  
    return co.sub(restr, desstr)

print(clean('光荣啊，中国共青团🙌🏻💗🚩'))

输出如下：