hive自定义函数过滤emoj表情符

mysql插入数据问题:java.sql.SQLException: Incorrect string value: ‘\xF0\x9F\x98\x8D\xE8\xBE…’ for column ‘job_title’ at row 1

问题原因:
数据中存在Emoj表情内容,每个字符占用4个字节,在Mysql中utf-8默认最大支持3个字节,超长了,所以报错了。
解决办法:

(1)在较新版本的Mysql上可选择修改数据类型为utf8mb4
(2)hive 数据处理过滤掉Emoj表情内容(Emoj数据一般无用),处理完再集成到MySQL数据库。用自定义函数
create temporary function StringFilter as ‘UppUDF.StringFilter’
using jar ‘hdfs://namenodeha/user/p66_u1038_upp_ludp1/tmp/StringFilter.jar’;
自定义函数代码如下:

import org.apache.commons.lang3.CharEncoding;
import org.apache.commons.lang3.CharUtils;
import org.apache.hadoop.hive.ql.exec.UDF;

import java.net.URLEncoder;
import java.nio.charset.StandardCharsets;

/***
 * 过滤emoj表情符
 *
 */
public class StringFilter extends UDF {
    public String evaluate(String str){
        if(str == null || str == ""){
            return null;
        }else{
            StringBuilder sb = new StringBuilder();
            byte[] bytes = str.getBytes(StandardCharsets.UTF_8);
            for(int i=0; i<bytes.length; i++) {
                byte b = bytes[i];
                if(CharUtils.isAscii((char)b)){
                    sb.append(new String(new byte[] {b}));
                }else if((b & 0xE0) == 0xC0) {
                    sb.append(new String(new byte[] {b, bytes[++i]}));
                }else if((b & 0xF0) == 0xE0) {
                    sb.append(new String(new byte[] {b, bytes[++i], bytes[++i]}));
                }else if((b & 0xF8) == 0xF0) {
                    String str1 = new String(new byte[] {b, bytes[++i], bytes[++i], bytes[++i]});
                    try{
                        sb.append(URLEncoder.encode(str1, CharEncoding.UTF_8));
                    }catch(Exception ignore) {

                    }
                }
            }
            return sb.toString();
        }
    }
}

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

不会飞的乌龟

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值