unicode字符集编码

katugo

于 2023-11-03 15:24:04 发布

阅读量285

点赞数

文章标签：笔记

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/yeyehenzui/article/details/134203828

版权

unicode字符集的编码范围是0X000000到0X10FFFF的，每个平面的范围都是0000到FFFF，共17个编码平面，编码平面用于存放不同类型的字符。
unicode编码表更像是一个字典，而编码方式则分为UTF-8编码和UTF-16编码、UTF-32编码。
- 目的是更加利于储存和传输
- 目的是提高电脑资源的利用效率，如UTF-8按原码点的话每个都需要三个字节来表示
- 码点：每个字符对应字符集的编码值（码点在Unicode字符集范围从U+000000到U+FFFFFF）
UTF-8编码：被定义为将码点编码为1至4个字节，具体编码字节数取决于码点数值的有效二进制的数量。
- UTF-8编码方式：

4. UTF-16编码：将字符编码成2字节或者4字节(UTF-8一个代码单元为一个字节，UTF-16一个代码单元为两个字节)

字节序列	码点位数	码点起值	码点终值	Byte1	Byte2	Byte3	Byte4
1	16	U+0000	U+FFFF	xxxxxxx	xxxxxxx
2	24	U+10000	U+10FFFF	110110xx	xxxxxxx	110111xx	xxxxxxx

在这里插入图片描述

5. 关于BOM：

字节序经常根据其在内存的存放顺序被分为两类，大端存储和小端存储
1. 字节序目的是为了解决一个多字节码元 code unit 中各字节的（地址）序
2. Big-Endian（大端）：高位字节排放在内存的低地址端，低位字节排放在内存的高地址端。
3. Little-Endian（小端）：低位字节排放在内存的低地址端，高位字节排放在内存的高地址端
4. 字节高低：靠近左边的是高位，靠右边的是低位
5. 内存地址高低：最高内存地址 0xFFFFFFFF
UTF字节序问题：最小编码单元是多字节才会有字节序的问题存在，UTF-8 最小编码单元是一字节，所以它是没有字节序的问题
BOM（字节序标记）常被用来当做标识文件是以 UTF-8、UTF-16 或 UTF-32 编码的标记

参考：

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
unicode字符集编码

4. UTF-16编码：将字符编码成2字节或者4字节(UTF-8一个代码单元为一个字节，UTF-16一个代码单元为两个字节)
复制链接

扫一扫

katugo CSDN认证博客专家 CSDN认证企业博客

码龄3年

3: 原创

193万+: 周排名

26万+: 总排名

336: 访问

: 等级

30: 积分

0: 粉丝

0: 获赞

0: 评论

0: 收藏

私信

关注

热门文章

您愿意向朋友推荐“博客详情页”吗？

强烈不推荐
不推荐
一般般
推荐
强烈推荐

提交

最新文章

目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。