（转）一个字符映射成比特的步骤

最新推荐文章于 2022-08-23 21:18:21 发布

Sky不是假的菜

最新推荐文章于 2022-08-23 21:18:21 发布

阅读量1.8k

点赞数

在现代编码模型里要知道一个字符如何映射成计算机里比特，需要经过如下几个步骤。

知道一个系统需要支持哪些字符，这些字符的集合被称为字符表（Character repertoire）
给字符表里的抽象字符编上一个数字，也就是字符集合到一个整数集合的映射。这种映射称为编码字符集（CCS:Coded Character Set）,unicode是属于这一层的概念，跟计算机里的什么进制啊没有任何关系，它是完全数学的抽象的。
将CCS里字符对应的整数转换成有限长度的比特值，便于以后计算机使用一定长度的二进制形式表示该整数。这个对应关系被称为字符编码表（CEF:Character Encoding Form）UTF-8, UTF-16都属于这层。
对于CEF得到的比特值具体如何在计算机中进行存储，传输。因为存在大端小端的问题，这就会跟具体的操作系统相关了。这种解决方案称为字符编码方案（CES:Character Encoding Scheme）。

平常我们所说的编码都在第三步的时候完成了,都没有涉及到CES。以上摘自（http://blog.jobbole.com/39309/）unicode只是一种抽象概念，使用一个数字来表示字符集中的一个字符，相当于规定了unicode字符集中那一百多万个字符和数字的映射，代码点就相当于这个字符对应着的数字了。Java中采用UTF-16编码方式对unicode进行表示（unicode是一种抽象概念，只确定了字符和码位的映射关系，不管编码），就是字符串的编码是utf-16，题主的例子中很清楚了。注意char类型16位，单个char肯定无法表示这一百多万个码位的，一但字符串中出现了char无法表示的码位（字符）的时候，这时候就用utf-16进行编码，用多个char表示这个码位，相应字符串的length方法也比字符要多（length是char数组的长度），用charat方法也不一定能获得那个字符，而要用codepointat方法获得那个位置所在的字符的unicode码位，我记得还有一个codepointsize方法，可以获得具体的（码位）字符数。再次强调一下，这个码位表示的是一个整数，是unicode编码里规定的某个字符想对应的整数。所幸大多数常用字符都能用一个char类型表示，所以一般length方法都能确定字符串中字符的个数，但这个方式看起来不是那么可靠，所以不是处理英文的地方，算字符数量的时候，还是考虑不要用length了吧。
以上。

作者：知乎用户
链接：https://www.zhihu.com/question/30241947/answer/47385874
来源：知乎

Sky不是假的菜

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
（转）一个字符映射成比特的步骤

在现代编码模型里要知道一个字符如何映射成计算机里比特，需要经过如下几个步骤。知道一个系统需要支持哪些字符，这些字符的集合被称为字符表（Character repertoire）给字符表里的抽象字符编上一个数字，也就是字符集合到一个整数集合的映射。这种映射称为编码字符集（CCS:Coded Character Set）,unicode是属于这一层的概念，跟计算机里的什么进制啊没有任何关系，它...
复制链接

扫一扫