python中汉字占几个字节,你知道utf-8编码中的一个中文汉字需要占有多少/几个字节表示或编码吗？...

weixin_39883433

于 2021-03-26 00:41:15 发布

阅读量1.2k

点赞数

文章标签： python中汉字占几个字节

在查找 UTF-8 编码资料时发现，很多的帖子说的 UTF-8 编码里，一个汉字占用3个字节，有的还做了个证明，大概是这样的，创建一个没有BOM的UTF-8编码的文本文件，里面保存了几个汉字，然后查看文件的大小。我觉得这样的证明没有一点说服力，因为 UTF-8 是变长的，1-6个字节，少量的汉字检测是不能说明所有的汉字都是的。

后来我又查看了字符映射表－汉语，找到了正确的答案，少数是汉字每个占用3个字节，多数占用4个字节。

占用3个字节的范围

[text] view plaincopy

U+2E80 - U+2EF3 : 0xE2 0xBA 0×80 - 0xE2 0xBB 0xB3 共 115 个

U+2F00 - U+2FD5 : 0xE2 0xBC 0×80 - 0xE2 0xBF 0×95 共 213 个

U+3005 - U+3029 : 0xE3 0×80 0×85 - 0xE3 0×80 0xA9 共 36 个

U+3038 - U+4DB5 : 0xE3 0×80 0xB8 - 0xE4 0xB6 0xB5 共 7549 个

U+4E00 - U+FA6A : 0xE4 0xB8 0×80 - 0xEF 0xA9 0xAA 共 44138 个

U+FA70 - U+FAD9 : 0xEF 0xA9 0xB0 - 0xEF 0xAB 0×99 共 105 个

合计： 52156 个

占用4个字节的范围

[text] view plaincopy

U+20000 - U+2FA1D : 0xF0 0xA0 0×80 0×80 - 0xF0 0xAF 0xA8 0x9D 共 64029 个

合计： 64029 个

GBK编码，一个汉字占两个字节。

UTF-16编码，通常汉字占两个字节，CJKV扩展B区、扩展C区、扩展D区中的汉字占四个字节(一般字符的Unicode范围是U+0000至U+FFFF，而这些扩展部分的范围大于U+20000，因而要用两个UTF-16)。

UTF-8编码是变长编码，通常汉字占三个字节，扩展B区以后的汉字占四个字节。

依据编码形式：

GB－231280 编码为 2个字节(Byte) 包含了 20902 个汉字，其编码范围是 0×8140-0xfefe。

GB18030-2000(GBK2K) 在 GBK 的基础上进一步扩展了汉字，增加了藏、蒙等少数民族的字形。编码是变长的，其二字节部分与 GBK 兼容；四字节部分是扩充的字形、字位，其编码范围是首字节 0×81-0xfe、二字节0×30-0×39、三字节 0×81-0xfe、四字节0×30-0×39

Unicode 范围一般所用为\U0000-\UFFFF，对于CJK EXT B区汉字，范围大于\U20000

UTF，按其基本长度所用位数分为UTF-8/16/32。其中：

UTF-8是变长编码，每个Unicode代码点按照不同范围，可以有1-3字节的不同长度。UTF-16长度相对固定，只要不处理大于\U200000范围的字符，每个Unicode代码点使用16位即2字节表示，超出部分使用两个UTF-16即4字节表示。按照高低位字节顺序，又分为UTF-16BE/UTF-16LE。

UTF-32长度始终固定，每个Unicode代码点使用32位即4字节表示。按照高低位字节顺序，又分为UTF-32BE/UTF-32LE。

weixin_39883433

关注

0
点赞
踩
3

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。