Unicode及UTF-8/16/32的定义及联系

最新推荐文章于 2023-07-13 06:33:59 发布

$*¥*$*

最新推荐文章于 2023-07-13 06:33:59 发布

阅读量230

点赞数

本文链接：https://blog.csdn.net/weixin_43853718/article/details/101229941

版权

2019/09/23

一、Unicode

1.发展历史：
Unicode（统一码、万国码、单一码）是计算机科学领域里的一项业界标准，包括字符集、编码方案等。Unicode 是为了解决传统的字符编码方案的局限而产生的，它为每种语言中的每个字符设定了统一并且唯一的二进制编码，以满足跨语言、跨平台进行文本转换、处理的要求。

2.编码方式：
目前实际应用的统一码版本对应于UCS-2，使用16位的编码空间。也就是每个字符占用2个字节。这样理论上一共最多可以表示2的16次（即65536）个字符。

   最新（但未实际广泛使用）的统一码版本定义了16个辅助平面，两者合起来至少需要占据21位的编码空间，比3字节略少。但事实上辅助平面字符仍然占用4字节编码空间，与UCS-4保持一致。未来版本会涵盖UCS-4的所有字符。UCS-4是一个更大的尚未填充完全的31位字符集，加上恒为0的首位，共需占据32位，即4字节。理论上最多能表示2的31次方个字符，完全可以涵盖一切语言所用的符号。

3.UCS:
通用字符集（Universal Character Set）是由ISO制定的ISO 10646（或称ISO/IEC 10646）标准所定义的标准字符集。

   通用字符集包括了其他所有字符集。它保证了与其他字符集的双向兼容，即，如果你将任何文本字符串翻译到UCS格式，然后再翻译回原编码，你不会丢失任何信息。UCS包含了已知语言的所有字符。

4.实现方式：
Unicode的实现方式称为Unicode转换格式（Unicode Transformation Format，简称为UTF）。
Unicode只是一个编码规范，目前实际实现的unicode编码只要有三种：UTF-8,UCS-2和UTF-16，三种unicode字符集之间可以按照规范进行转换。

     前面说到，Unicode采用2个字节来编码文件，但是如果一个仅包含7位ASCII字符的Unicode文件，每个字符使用2字节就浪费了一般的存储空间，其第一字节的8位始终为0。对于这种情况，可以使用UTF-8编码，这是一种变长编码，它将基本7位ASCII字符仍用7位编码表示，占用一个字节（首位补0）。而遇到与其他Unicode字符混合的情况，将按一定算法转换，每个字符使用1-3个字节编码，并利用首位为0或1进行识别。
     类似的，对未来会出现的需要4个字节的辅助平面字符和其他UCS-4扩充字符，2字节编码的UTF-16也需要通过一定的算法进行转换。

二、UTF-8

   UTF-8是一种8位的unicode字符集，编码长度是可变的，变长的目的是节省空间。并且是ASCII字符集的严格超集，也就是说ASCII中每个字符的编码在UTF-8中是完全一样的。UTF-8字符集中，一个字符可能是1个字节，2个字节，3个字节或者4个字节长。一般来说，欧洲的字母字符长度为1到2个字节，而亚洲的大部分字符则是3个字节，附加字符为4个字节长。

 Unix平台中普遍支持UTF-8字符集，HTML和大多数浏览器也支持UTF-8，而window和java则支持UCS-2。

UTF-8使用一至六个字节为每个字符编码（2003年11月UTF-8被RFC 3629重新规范，只能使用原来Unicode定义的区域，U+0000到U+10FFFF，也就是说最多四个字节）。

以下是Unicode和UTF-8之间的转换关系表：
　　U-00000000 - U-0000007F: 0xxxxxxx
　　U-00000080 - U-000007FF: 110xxxxx 10xxxxxx
　　U-00000800 - U-0000FFFF: 1110xxxx 10xxxxxx 10xxxxxx
　　U-00010000 - U-001FFFFF: 11110xxx 10xxxxxx 10xxxxxx 10xxxxxx
　　U-00200000 - U-03FFFFFF: 111110xx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx
　　U-04000000 - U-7FFFFFFF: 1111110x 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx

编码规则：

1、128个US-ASCII字符只需一个字节编码（Unicode范围由U+0000至U+007F）。

2、带有附加符号的拉丁文、希腊文、西里尔字母、亚美尼亚语、希伯来文、阿拉伯文等则需要两个字节编码（Unicode范围由U+0080至U+07FF）。

3、其他基本多文种平面（BMP）中的字元（这包含了大部分常用字，如大部分的汉字）使用三个字节编码（Unicode范围由U+0800至U+FFFF）。

4、其他极少使用的Unicode 辅助平面的字元使用四至六字节编码。（Unicode范围由U+10000至U+1FFFFF使用四字节，Unicode范围由U+200000至U+3FFFFFF使用五字节，Unicode范围由U+4000000至U+7FFFFFFF使用六字节）。

三、UTF-16

UTF-16是Unicode字符编码五层次模型的第三层：字符编码表。即把Unicode字符集的抽象码位映射为16位长的整数，用于数据存储或传递。Unicode字符的码位，需要1个或者2个16位长的码元来表示，因此这是一个变长表示。
Unicode的编码空间从U+0000到+10FFFF，共有1,112,064个码位（code point）可用来映射字符. Unicode的编码空间可以划分为17个平面（plane），每个平面包含216（65,536）个码位。17个平面的码位可表示为从U+xx0000到U+xxFFFF,其中xx表示十六进制值从0016到1016，共计17个平面。
第一个平面称为基本多语言平面（Basic Multilingual Plane, BMP），或称第零平面（Plane 0）。其他平面称为辅助平面（Supplementary Planes）。基本多语言平面内，从U+D800到U+DFFF之间的码位区段是永久保留不映射到Unicode字符。UTF-16就利用保留下来的0xD800-0xDFFF区段的码位来对辅助平面的字符的码位进行编码。

四、UTF-32

UTF-32 是固定长度的编码，始终占用 4 个字节，足以容纳所有的 Unicode 字符，所以直接存储 Unicode 编号即可，不需要任何编码转换。浪费了空间，提高了效率。

只有 UTF-8 兼容 ASCII，UTF-32 和 UTF-16 都不兼容 ASCII，因为它们没有单字节编码。

参考文章：
1.https://blog.csdn.net/guxiaonuan/article/details/78678043
2.https://link.jianshu.com/?t=https://zh.wikipedia.org/wiki/UTF-16
3.https://link.jianshu.com/?t=https://zh.wikipedia.org/wiki/Unicode
4.https://link.jianshu.com/?t=https://zh.wikipedia.org/wiki/UTF-8

$*¥*$*

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
Unicode及UTF-8/16/32的定义及联系

2019/09/23一、Unicode1.发展历史：Unicode（统一码、万国码、单一码）是计算机科学领域里的一项业界标准，包括字符集、编码方案等。Unicode 是为了解决传统的字符编码方案的局限而产生的，它为每种语言中的每个字符设定了统一并且唯一的二进制编码，以满足跨语言、跨平台进行文本转换、处理的要求。2.编码方式：目前实际应用的统一码版本对应于UCS-2，使用16位的编码空间。...
复制链接

扫一扫