java mysql 生僻字_mysql/Java服务端对emoji或者生僻字的支持

最新推荐文章于 2023-07-17 15:55:49 发布

悅目

最新推荐文章于 2023-07-17 15:55:49 发布

阅读量576

点赞数

文章标签： java mysql 生僻字

本文链接：https://blog.csdn.net/weixin_32281549/article/details/113212203

版权

最近开发的iOS项目因为需要用户文本的存储，自然就遇到了emoji等表情符号如何被mysql DB支持的问题。困扰了数日，在就要绝望放弃的边缘，终于完成了转换和迁移。在此特别分析和整理，方便更多人。

问题描述：

如果UTF8字符集且是Java服务器的话，当存储含有emoji表情时，会抛出类似如下异常：

java.sql.SQLException: Incorrect string value: '\xF0\x9F\x92\x94' for column 'name' at row 1

at com.mysql.jdbc.SQLError.createSQLException(SQLError.java:1073)

at com.mysql.jdbc.MysqlIO.checkErrorPacket(MysqlIO.java:3593)

at com.mysql.jdbc.MysqlIO.checkErrorPacket(MysqlIO.java:3525)

at com.mysql.jdbc.MysqlIO.sendCommand(MysqlIO.java:1986)

at com.mysql.jdbc.MysqlIO.sqlQueryDirect(MysqlIO.java:2140)

at com.mysql.jdbc.ConnectionImpl.execSQL(ConnectionImpl.java:2620)

at com.mysql.jdbc.StatementImpl.executeUpdate(StatementImpl.java:1662)

at com.mysql.jdbc.StatementImpl.executeUpdate(StatementImpl.java:1581)

这就是字符集不支持的异常。因为UTF-8编码有可能是两个、三个、四个字节，其中Emoji表情是4个字节，而Mysql的utf8编码最多3个字节，所以导致了数据插不进去。

升级前需要考虑的问题：

如果你的项目要进行移动产品的用户文本的存储，将你的DB字符集从UTF8/GBK等传统字符集升级到utf8mb4将是势在必行。你可以通过应用层面转换emoji等特殊字符，以达到原DB的兼容，我认为可行，但是你可能走了弯路。

utf8mb4作为utf8的super set，完全向下兼容，所以不用担心字符的兼容性问题。切换中需要顾虑的主要影响是mysql需要重新启动(虽然mysql官方文档说可以动态修改配置，但是经过数次测试，还是需要重启才可生效)，对于业务可用率的影响是需要考虑的大问题，这里就暂时不展开讨论了。

升级步骤：

1.utf8mb4的最低mysql版本支持版本为5.5.3+，若不是，请升级到较新版本。

2.修改database、table和column字符集。

参考以下语句：

(1)ALTER DATABASE database_name CHARACTER SET = utf8mb4 COLLATE = utf8mb4_unicode_ci;

(2)ALTER TABLE table_name CONVERT TO CHARACTER SET utf8mb4 COLLATE utf8mb4_unicode_ci;

(3)ALTER TABLE table_name CHANGE column_name column_name VARCHAR(191) CHARACTER SET utf8mb4 COLLATE utf8mb4_unicode_ci;

3.修改mysql配置文件my.cnf(windows为my.ini)

my.cnf一般在etc/mysql/my.cnf位置。找到后请在以下三部分里添加如下内容：

[client]

default-character-set = utf8mb4

[mysql]

default-character-set = utf8mb4

[mysqld]

character-set-client-handshake = FALSE

character-set-server = utf8mb4

collation-server = utf8mb4_unicode_ci

init_connect='SET NAMES utf8mb4'

4.重启 MySQL Server、检查字符集

1.)重启命令参考：/etc/init.d/mysql restart

2.)输入命令：mysql，进入mysql命令行(如果提示没权限，可以尝试输入mysql -uroot -p你的密码)

3.)在mysql命令行中输入：SHOW VARIABLES WHERE Variable_name LIKE 'character_set_%' OR Variable_name LIKE 'collation%';

检查是否如下：

+--------------------------+--------------------+

| Variable_name | Value |

+--------------------------+--------------------+

| character_set_client | utf8mb4 |

| character_set_connection | utf8mb4 |

| character_set_database | utf8mb4 |

| character_set_filesystem | binary |

| character_set_results | utf8mb4 |

| character_set_server | utf8mb4 |

| character_set_system | utf8 |

| collation_connection | utf8mb4_unicode_ci |

| collation_database | utf8mb4_unicode_ci |

| collation_server | utf8mb4_unicode_ci |

+--------------------------+--------------------+

rows in set (0.00 sec)

特别说明下：collation_connection/collation_database/collation_server如果是utf8mb4_general_ci，没有关系。但必须保证character_set_client/character_set_connection/character_set_database/character_set_results/character_set_server为utf8mb4。

5.如果你用的是java服务器，升级或确保你的mysql connector版本高于5.1.13，否则仍然无法使用utf8mb4,同时记得修改pom配置哦~

6.检查你服务端的db配置文件：

jdbc.driverClassName=com.mysql.jdbc.Driver

jdbc.url=jdbc:mysql://localhost:3306/database?useUnicode=true&characterEncoding=utf8&autoReconnect=true&rewriteBatchedStatements=TRUE

jdbc.username=root

jdbc.password=password

特别说明其中的jdbc.url配置：如果你已经升级好了mysql-connector，其中的characterEncoding=utf8可以被自动被识别为utf8mb4(当然也兼容原来的utf8)，而autoReconnect配置我强烈建议配上，我之前就是忽略了这个属性，导致因为缓存缘故，没有读取到DB最新配置，导致一直无法使用utf8mb4字符集，多么痛的领悟！！

附上数据库的一些语句:

ALTER DATABASE `hwhmd` CHARACTER SET = utf8mb4 COLLATE = utf8mb4_unicode_ci;

ALTER TABLE `customer` CONVERT TO CHARACTER SET utf8mb4 COLLATE utf8mb4_unicode_ci;

ALTER TABLE`customer` CHANGE `NAME` `NAME` VARCHAR(191) CHARACTER SET utf8mb4 COLLATE utf8mb4_unicode_ci;

SHOW VARIABLES WHERE Variable_name LIKE 'character_set_%' OR Variable_name LIKE 'collation%';

SET character_set_server=utf8mb4

SET character_set_results=gbk

SET COLLATION_CONNECTION = utf8_general_ci;

SET COLLATION_SERVER = utf8_general_ci;

SET NAMES 'utf8mb4';

本地测试的时候不知道怎么回事:hibernate在插入生僻字'𥔲'的时候,一直报错:

Caused by: java.sql.SQLException: Incorrect string value: '\xF0\xA5\x94\xB2' for column 'name' at row 1

该设置的地方都设置到了,感觉也没有什么问题了,但是hibernate就是不支持这个生僻字的插入,这个问题先放出来,留待以后解决,我暂时的解决方法是把这个字段的编码改为:utf8mb4和字段的校验改为:utf8mb4_general_ci,然后在插入之前执行:SET NAMES 'utf8mb4',之后再手动插入这个字'𥔲'...以为hibernate不支持这个字,所以在查询的时候,如果查询条件里面包含这个字'𥔲',那么这个查询条件在数据库中被处理的时候这个字'𥔲'本身就是乱码了,再利用校验条件utf8mb4_general_ci检查的时候,会报这个错误:

java.sql.SQLException: Illegal mix of collations (utf8mb4_general_ci,IMPLICIT) and (utf8_general_ci,COERCIBLE) for operation ...

当然,如果查询条件在utf-8的字符集范围之中,是没有任何问题的

悅目

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
java mysql 生僻字_mysql/Java服务端对emoji或者生僻字的支持

最近开发的iOS项目因为需要用户文本的存储，自然就遇到了emoji等表情符号如何被mysql DB支持的问题。困扰了数日，在就要绝望放弃的边缘，终于完成了转换和迁移。在此特别分析和整理，方便更多人。问题描述：如果UTF8字符集且是Java服务器的话，当存储含有emoji表情时，会抛出类似如下异常：java.sql.SQLException: Incorrect string value: '\xF...
复制链接

扫一扫