mysql utf8 中文 长度_MySql中UTF8 和 GBK 编码中文字符长度问题

MySql中UTF8 和 GBK 编码中文字符长度问题

出处:http://blog.csdn.net

为什么要了解MySql中UTF8 和 GBK 编码中文字符长度呢?举个例子,在oracle中用utf8 字段中文长度为1的话,需要char(3),mysql中则是char(1),如果你按照oracle的做法去创建mysql字段,是不是在mysql表中创建的长度大小与自己锁想的不一样呢,所以这个小知识点还是有必要了解的。

我在经过实验后得到以下结论(适用MySQL 5.0以上版本):

1.一个汉字占多少长度与编码有关:

UTF-8:一个汉字=3个字节

GBK:一个汉字=2个字节

2.在MySQL中 varchar(n)和char(n)表示n个字符,无论汉字和英文,Mysql都能存入n个字符,仅是实际字节长度有所区别

即 MySQL 并不会对超过长度的字符报错,而是直接截断了. 并且 char(2) 和 varchar(2) 都能存储 2个汉字,或者是两个英文字符.

3. MySQL 的 char(n) 和varchar(n) 可以直接存储 n 个汉字. 而不是 n/3或者 n/2 个,mysql 屏蔽了具体的存储细节,而直接以实际字符的个数来决定char存储的个数

提示:MySQL检查长度,可用SQL语言:

select LENGTH(fieldname) from tablename 和 select CHAR_LENGTH(fieldname) from tablename 来查看

说明:LENGTH 输出的结果是 字符实际长度的,而 CHAR_LENGTH输出的则是屏蔽了字符存储细节,是实际的字符个数!

注:在涉及中文环境下的php+mysql组合,最好是用 mb_strlen来检测字符长度, 而在mysql 中,使用 CHAR_LENGTH来检测字符长度,这样能做到中英文统一处理.

php中strlen和mb_strlen,count的区别:

strlen 计算字符串长度,一个中文当2字符;mb_strlen根据它的字符编码模式,统计字符;count计算数组中的元素数目或对象中的属性个数

下面我们来验证下我们的结论是否正确:

测试一:

首先,我们先来测试一下 php 把一个汉字认作几个字节:

UTF8测试

header("Content-type:text/html;charset=utf-8");

$string1="字";//定义中文字符变量

$string2="x";//定义英文字符变量

//直接输出看看他们的长度

echo strlen($string1);

echo "";

echo strlen($string2);

echo "";

//用 php 多字节扩展函数 mb_strlen试试看

echo mb_strlen($string1,'utf8');

echo "";

echo mb_strlen($string2,'utf8');

echo "";

?>

注:测试的时候请将test.php文件的编码也改为utf8 ,否则会出现strlen长度为2的情况,得不到正确的结果

输出:

0818b9ca8b590ca3270a3433284dd417.png

GBK测试:

header("Content-type:text/html;charset=gbk");

$string1="字";//定义中文字符变量

$string2="x";//定义英文字符变量

//直接输出看看他们的长度

echo strlen($string1);

echo "";

echo strlen($string2);

echo "";

//用 php 多字节扩展函数 mb_strlen试试看

echo mb_strlen($string1,'gbk');

echo "";

echo mb_strlen($string2,'gbk');

echo "";

?>

输出:

0818b9ca8b590ca3270a3433284dd417.png

结论1.一个汉字占多少长度与编码有关:

UTF-8:一个汉字=3个字节

GBK:一个汉字=2个字节

测试二:

首先我们来测试UTF8

创建UTF8编码的数据库

CREATE DATABASE `testutf8` DEFAULT CHARACTER SET utf8 COLLATE utf8_general_ci;

创建utf8编码的表test

CREATE TABLE test(

txt_charchar( 2 ) NULL ,

txt_varchar varchar( 2 ) NULL

) ENGINE = MYISAM

确认表字段是否为utf8

0818b9ca8b590ca3270a3433284dd417.png

插入两条记录:

INSERT INTO test(txt_char,txt_varchar) VALUES ('abcdef','uvwxyz') , ('我是测试的','测试的是我');

插入结果:

0818b9ca8b590ca3270a3433284dd417.png

创建test2表

CREATE TABLE `testutf8`.`test2` (

`txt_char` CHAR( 2 ) CHARACTER SET gbk COLLATE gbk_chinese_ci NOT NULL ,

`txt_varchar` VARCHAR( 2 ) CHARACTER SET gbk COLLATE gbk_chinese_ci NOT NULL

) ENGINE = MYISAM

确认表字段是否为gbk

0818b9ca8b590ca3270a3433284dd417.png

插入两条记录:

INSERT INTO test(txt_char,txt_varchar) VALUES ('abcdef','uvwxyz') , ('我是测试的','测试的是我');

插入结果:

0818b9ca8b590ca3270a3433284dd417.png

结论二:

证明 mysql 并不会对超过长度的字符报错,而是直接截断了. 并且 char(2) 和 varchar(2) 都能存储 2个汉字,或者是两个英文字符. 证明 mysql 的 char(n) 可以直接存储 n 个汉字. 而不是 n/3 个 mysql 屏蔽了具体的存储细节,而直接以实际字符的个数来决定 char存储的个数

  • 0
    点赞
  • 1
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
### 回答1: 在 MySQL ,如果数据库的字符集设置为 UTF-8,但表字段的字符集设置为 GBK,会导致以下影响: 1. 在存储数据时会出现乱码,因为 MySQL 会将数据从 UTF-8 编码转换为 GBK 编码,但 GBK 编码无法正确表示 UTF-8 编码的所有字符,所以会出现乱码。 2. 在查询数据时会出现问题,因为 MySQL 会将查询结果从 GBK 编码转换为 UTF-8 编码,但 GBK 编码无法正确表示 UTF-8 编码的所有字符,所以会出现问题。 建议将数据库和表字段的字符集都设置为 UTF-8,这样可以避免上述问题。 ### 回答2: 当MySQL数据库的字符集为utf-8,但表字段字符集为gbk时,会出现以下影响: 1. 存储问题:由于utf-8是一种多字节字符集,而gbk是一种双字节字符集,所以当在utf-8数据库存储gbk字符时,会导致一个gbk字符占用更多的存储空间,可能引起数据浪费。 2. 编码问题:当utf-8数据库的表字段字符集为gbk时,会导致编码不一致。当从应用程序插入或读取数据时,可能会出现字符编码乱码或无法正常显示的情况,特别是在处理特殊字符时更容易出现问题。 3. 排序和比较问题:utf-8和gbk字符集具有不同的排序规则和比较方式。如果在不同字符集之间比较和排序数据,可能导致错误的结果。 4. 查询问题:如果在utf-8数据库表gbk字段上进行查询,可能会导致查询结果不准确或无法正常检索到数据。 综上所述,当MySQL数据库字符集为utf-8,但表字段字符集为gbk时,可能会导致存储、编码、排序和查询等方面的问题。为避免这些问题,建议一致地设置字符集,即数据库和表字段应该采用相同的字符集,例如utf-8字符集。 ### 回答3: 当MySQL数据库的字符集为UTF-8(或UTF-8编码的别名)时,它可以存储包括汉字在内的各种国际字符集,并且支持多种语言的数据存储与查询。而表字段字符集为GBK,则表示该字段的数据只能使用GBK字符集进行存储和检索。 对于数据库字符集为UTF-8但表字段字符集为GBK的情况,会产生以下影响: 1. 数据存储:当使用UTF-8的字符集插入数据到字段时,MySQL会首先将UTF-8字符集转换为GBK字符集,然后再存储到表字段。这可能导致一些特殊字符无法正确保存或显示。 2. 字符编码转换:如果从数据库查询数据并将其显示在页面上时,数据库会将存储在GBK字符的数据转换为UTF-8字符集进行显示。这种字符编码转换可能会导致数据显示异常或乱码。 3. 查询效率:由于MySQL需要进行字符集转换,从UTF-8到GBK或从GBK到UTF-8的转换会消耗一定的计算资源和时间。在大数据量或复杂查询的情况下,这些转换可能会降低查询效率。 因此,建议在设计数据库时,数据库的字符集和表字段的字符集应保持一致,以避免字符集转换引起的问题。如果需要存储和处理多语言数据,推荐使用UTF-8字符集,它能够更好地支持各种语言和字符集。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值