字符编码知识合集

最新推荐文章于 2022-05-02 16:50:31 发布

simple_whu

最新推荐文章于 2022-05-02 16:50:31 发布

阅读量111

点赞数

文章标签：计算机基础

原文链接：https://www.zhihu.com/question/19677619

版权

字符编码知识合集

关于Unicode, utf-8, GBK, GB2312等

Unicode与utf-8

参照知乎问题https://www.zhihu.com/question/23374078下的回答，选择了我最感兴趣的两个：

作者：邱昊宇
链接：https://www.zhihu.com/question/23374078/answer/24385963
简单来说：

Unicode 是「字符集」
UTF-8 是「编码规则」

其中：

字符集：为每一个「字符」分配一个唯一的 ID（学名为码位 / 码点 / Code Point）
编码规则：将「码位」转换为字节序列的规则（编码/解码可以理解为加密/解密的过程）

广义的 Unicode 是一个标准，定义了一个字符集以及一系列的编码规则，即 Unicode 字符集和 UTF-8、UTF-16、UTF-32 等等编码……

Unicode 字符集为每一个字符分配一个码位，例如「知」的码位是 30693，记作 U+77E5（30693 的十六进制为 0x77E5）。

UTF-8 顾名思义，是一套以 8 位为一个编码单位的可变长编码。会将一个码位编码为 1 到 4 个字节。

作者：uuspider
链接：https://www.zhihu.com/question/23374078/answer/65352538

举一个例子：It’s 知乎日报
你看到的unicode字符集是这样的编码表：

I 0049
t 0074
' 0027
s 0073
  0020
知 77e5
乎 4e4e
日 65e5
报 62a5

每一个字符对应一个十六进制数字。
计算机只懂二进制，因此，严格按照unicode的方式(UCS-2)，应该这样存储：

I 00000000 01001001
t 00000000 01110100
' 00000000 00100111
s 00000000 01110011
  00000000 00100000
知 01110111 11100101
乎 01001110 01001110
日 01100101 11100101
报 01100010 10100101

这个字符串总共占用了18个字节，但是对比中英文的二进制码，可以发现，英文前9位都是0！浪费啊，浪费硬盘，浪费流量。怎么办？UTF。
UTF-8是这样做的：

单字节的字符，字节的第一位设为0，对于英语文本，UTF-8码只占用一个字节，和ASCII码完全相同；
n个字节的字符(n>1)，第一个字节的前n位设为1，第n+1位设为0，后面字节的前两位都设为10，这n个字节的其余空位填充该字符unicode码，高位用0补足。

这样就形成了如下的UTF-8标记位：

0xxxxxxx
110xxxxx 10xxxxxx
1110xxxx 10xxxxxx 10xxxxxx
11110xxx 10xxxxxx 10xxxxxx 10xxxxxx
111110xx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx
1111110x 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx
... ...

于是，”It’s 知乎日报“就变成了：

I 01001001
t 01110100
' 00100111
s 01110011
  00100000
知 11100111 10011111 10100101
乎 11100100 10111001 10001110
日 11100110 10010111 10100101
报 11100110 10001010 10100101

和上边的方案对比一下，英文短了，每个中文字符却多用了一个字节。但是整个字符串只用了17个字节，比上边的18个短了一点点。

下边是课后作业：请将”It’s 知乎日报“的GB2312和GBK码(自行google)转成二进制。不考虑历史因素，从技术角度解释为什么在unicode和UTF-8大行其道的同时，GB2312和GBK仍在广泛使用。
剧透：一切都是为了节省你的硬盘和流量。

GBK, GB2312与GB18030的区别

GB2312、GBK、GB18030 这几种字符集的主要区别是什么？ - 知乎
https://www.zhihu.com/question/19677619

simple_whu

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
字符编码知识合集

字符编码知识合集关于Unicode, utf-8, GBK, GB2312等Unicode与utf-8参照知乎问题https://www.zhihu.com/question/23374078下的回答，选择了我最感兴趣的两个：作者：邱昊宇链接：https://www.zhihu.com/question/23374078/answer/24385963简单来说：Unicode 是「字符集」UTF-8 是「编码规则」其中：字符集：为每一个「字符」分配一个唯一的 ID（学名为码位
复制链接

扫一扫