MySql中UTF8 和 GBK 编码中文字符长度问题

最新推荐文章于 2024-08-08 14:08:21 发布

葡萄干是个程序员

最新推荐文章于 2024-08-08 14:08:21 发布

阅读量2.8k

点赞数

分类专栏： MySQL 文章标签： mysql utf-8 编码 char varchar

MySQL 专栏收录该内容

10 篇文章 0 订阅

订阅专栏

转载自：MySql中UTF8 和 GBK 编码中文字符长度问题

MySql中UTF8 和 GBK 编码中文字符长度问题

出处：http://blog.csdn.net

为什么要了解MySql中UTF8 和 GBK 编码中文字符长度呢？举个例子，在oracle中用utf8 字段中文长度为1的话，需要char（3）,mysql中则是char（1），如果你按照oracle的做法去创建mysql字段，是不是在mysql表中创建的长度大小与自己锁想的不一样呢，所以这个小知识点还是有必要了解的。
我在经过实验后得到以下结论（适用MySQL 5.0以上版本）：

1.一个汉字占多少长度与编码有关：
UTF-8：一个汉字＝3个字节
GBK：一个汉字＝2个字节
2.在MySQL中 varchar(n)和char(n)表示n个字符，无论汉字和英文，Mysql都能存入n个字符，仅是实际字节长度有所区别

即 MySQL 并不会对超过长度的字符报错,而是直接截断了. 并且 char(2) 和 varchar(2) 都能存储 2个汉字,或者是两个英文字符.
3. MySQL 的 char(n) 和varchar(n) 可以直接存储 n 个汉字. 而不是 n/3或者 n/2 个，mysql 屏蔽了具体的存储细节,而直接以实际字符的个数来决定char存储的个数

提示：MySQL检查长度，可用SQL语言：
select LENGTH(fieldname) from tablename 和 select CHAR_LENGTH(fieldname) from tablename 来查看

说明：LENGTH 输出的结果是字符实际长度的，而 CHAR_LENGTH输出的则是屏蔽了字符存储细节,是实际的字符个数!

注：在涉及中文环境下的php+mysql组合,最好是用 mb_strlen来检测字符长度, 而在mysql 中,使用 CHAR_LENGTH来检测字符长度,这样能做到中英文统一处理.
php中strlen和mb_strlen，count的区别：

strlen 计算字符串长度，一个中文当2字符；mb_strlen根据它的字符编码模式，统计字符；count计算数组中的元素数目或对象中的属性个数

下面我们来验证下我们的结论是否正确：

测试一：

首先，我们先来测试一下 php 把一个汉字认作几个字节:

UTF8测试

<?php
header("Content-type:text/html;charset=utf-8");
$string1="字";//定义中文字符变量
$string2="x";//定义英文字符变量

//直接输出看看他们的长度
echo strlen($string1);
echo "</br>";
echo strlen($string2);
echo "</br>";

//用 php 多字节扩展函数 mb_strlen试试看
echo mb_strlen($string1,'utf8');
echo "</br>";
echo mb_strlen($string2,'utf8');
echo "</br>";

?>

注：测试的时候请将test.php文件的编码也改为utf8 ，否则会出现strlen长度为2的情况，得不到正确的结果

输出：

GBK测试：

<?php
header("Content-type:text/html;charset=gbk");
$string1="字";//定义中文字符变量
$string2="x";//定义英文字符变量

//直接输出看看他们的长度
echo strlen($string1);
echo "</br>";
echo strlen($string2);
echo "</br>";

//用 php 多字节扩展函数 mb_strlen试试看
echo mb_strlen($string1,'gbk');
echo "</br>";
echo mb_strlen($string2,'gbk');
echo "</br>";

?>

输出：

结论1.一个汉字占多少长度与编码有关：
UTF-8：一个汉字＝3个字节
GBK：一个汉字＝2个字节

测试二：

首先我们来测试UTF8

创建UTF8编码的数据库

CREATE DATABASE `testutf8` DEFAULT CHARACTER SET utf8 COLLATE utf8_general_ci;

创建utf8编码的表test

CREATE TABLE test(
txt_charchar( 2 ) NULL ,
txt_varchar varchar( 2 ) NULL 
) ENGINE = MYISAM

确认表字段是否为utf8

插入两条记录：

INSERT INTO test(txt_char,txt_varchar) VALUES ('abcdef','uvwxyz') , ('我是测试的','测试的是我');

插入结果：

创建test2表

CREATE TABLE `testutf8`.`test2` (
`txt_char` CHAR( 2 ) CHARACTER SET gbk COLLATE gbk_chinese_ci NOT NULL ,
`txt_varchar` VARCHAR( 2 ) CHARACTER SET gbk COLLATE gbk_chinese_ci NOT NULL 
) ENGINE = MYISAM

确认表字段是否为gbk

插入两条记录：

INSERT INTO test(txt_char,txt_varchar) VALUES ('abcdef','uvwxyz') , ('我是测试的','测试的是我');

插入结果：

结论二：

证明 mysql 并不会对超过长度的字符报错,而是直接截断了.
并且 char(2) 和 varchar(2) 都能存储 2个汉字,或者是两个英文字符.
证明 mysql 的 char(n) 可以直接存储 n 个汉字. 而不是 n/3 个
mysql 屏蔽了具体的存储细节,而直接以实际字符的个数来决定 char存储的个数