mysql插入数据问题:java.sql.SQLException: Incorrect string value: ‘\xF0\x9F\x98\x8D\xE8\xBE…’ for column ‘job_title’ at row 1
问题原因:
数据中存在Emoj表情内容,每个字符占用4个字节,在Mysql中utf-8默认最大支持3个字节,超长了,所以报错了。
解决办法:
(1)在较新版本的Mysql上可选择修改数据类型为utf8mb4
(2)hive 数据处理过滤掉Emoj表情内容(Emoj数据一般无用),处理完再集成到MySQL数据库。用自定义函数
create temporary function StringFilter as ‘UppUDF.StringFilter’
using jar ‘hdfs://namenodeha/user/p66_u1038_upp_ludp1/tmp/StringFilter.jar’;
自定义函数代码如下:
import org.apache.commons.lang3.CharEncoding;
import org.apache.commons.lang3.CharUtils;
import org.apache.hadoop.hive.ql.exec.UDF;
import java.net.URLEncoder;
import java.nio.charset.StandardCharsets;
/***
* 过滤emoj表情符
*
*/
public class StringFilter extends UDF {
public String evaluate(String str){
if(str == null || str == ""){
return null;
}else{
StringBuilder sb = new StringBuilder();
byte[] bytes = str.getBytes(StandardCharsets.UTF_8);
for(int i=0; i<bytes.length; i++) {
byte b = bytes[i];
if(CharUtils.isAscii((char)b)){
sb.append(new String(new byte[] {b}));
}else if((b & 0xE0) == 0xC0) {
sb.append(new String(new byte[] {b, bytes[++i]}));
}else if((b & 0xF0) == 0xE0) {
sb.append(new String(new byte[] {b, bytes[++i], bytes[++i]}));
}else if((b & 0xF8) == 0xF0) {
String str1 = new String(new byte[] {b, bytes[++i], bytes[++i], bytes[++i]});
try{
sb.append(URLEncoder.encode(str1, CharEncoding.UTF_8));
}catch(Exception ignore) {
}
}
}
return sb.toString();
}
}
}