.length()方法返回的是char的数量，而不是字节数

程昫圆

于 2024-05-19 15:26:00 发布

阅读量775

点赞数 14

分类专栏： java 文章标签：开发语言 java

本文链接：https://blog.csdn.net/2301_77118121/article/details/139041997

版权

java 专栏收录该内容

27 篇文章 0 订阅

订阅专栏

一、. length()返回的char数量

在Java中，字符串String是由字符序列组成的，每个char类型元素占两个字节。对于包含非ASCII字符（如中文字符）的字符串，.length()方法返回的是char的数量，而不是字节数。

关于字符串的方法，如下代码执行结果是（）。
String fileName = "中国China"; 
System.out.println(fileName.length());
给定的字符串 "中国China" 包含：

2个中文字符：中 和 国
5个英文字符：C, h, i, n, a

因此，字符串 "中国China" 总共包含 2 + 5 = 7 个 char。

执行结果将输出：7

二、字节、字符

字节（Byte）是计算机存储和内存的基本单位，通常一个字节由8位比特（Bit）组成，可以表示256种不同的状态。字符则是文本的组成部分，例如字母、数字、标点符号等，它们是用户可读的符号。

1Byte (1B)= 8 bit（8b）

tips：

1KB=1024B

1MB=1024KB

1GB=1024MB

1TB=1024GB

其次，为了能在计算机中存储和处理这些字符，必须将它们转换成二进制形式，即编码。编码是一个过程，它将字符集中的每个字符映射到一组特定的字节上。不同的编码方案有不同的映射规则，如ASCII码、UTF-8、Unicode等。例如，在ASCII码中，一个英文字符通常占用一个字节，而在UTF-8编码中，一个英文字符等于一个字节，中文字符则可能占用两个或三个字节。

字符、汉字占用的字节数

在Java中，字符是以Unicode编码的形式存储的。Unicode是一个国际标准，它为世界上大多数的文字系统的每一个字符、标点符号和文字分隔符分配了一个独特的数字。这些数字称为代码点，它们用于表示文本文件中的字符。

英文字符：英文字符，包括字母、数字和一些标点符号，在ASCII码表中都有对应的值。由于ASCII码是7位的，所以这些字符在计算机中通常用一个字节（8位）来表示。在Java中，这些字符的编码值范围在0到127之间。
汉字：汉字在Unicode中的范围要广泛得多，因此它们通常需要更多的字节来表示。在UTF-8编码中，一个汉字可能占用两个或三个字节。这是因为UTF-8是一种变长编码，它可以使用1到4个字节来表示不同的字符。对于汉字来说，它们的Unicode代码点通常在0x4E00到0x9FFF之间，这超出了单字节可以表示的范围。

在处理字符串时，Java提供了强大的支持，可以进行字符串的遍历、编码转换和判断等操作。例如，可以通过遍历字符串中的每个字符，并检查其Unicode值来判断它是英文字符还是汉字。此外，当涉及到字符串的输出对齐时，可以选择等宽字体来确保每个字符占据相同的空间，这样英文字符和汉字就可以在视觉上保持一致的对齐。总的来说，了解字符在Java中的表示方式对于正确处理文本数据非常重要，尤其是在涉及多种语言和字符集的应用程序中。

如何查询汉字占用的字节数

在Java中，汉字占用的字节数可以通过判断其编码方式来确定。以下是具体的判断方法：

检查编码声明：要查看源代码或配置文件中指定的编码方式，因为不同的编码方式会影响字符占用的字节数。
使用Unicode编码：如果使用的是Unicode编码，如UTF-16或UTF-32，那么可以通过计算字符串中字符的数量来判断。由于在Unicode编码中，一个代理对（surrogate pair）由两个char值组成，代表一个代码点，所以可以通过计数代理对的数量来获取总的字符数量。
使用UTF-8编码：对于UTF-8编码，可以通过将字符串转换为字节数组，然后检查每个字符对应的字节数。对于汉字，通常占用3个字节。
考虑增补字符：对于那些超出基本多文种平面（BMP）的字符，即那些码点在0x10000到0x10FFFF之间的字符，它们在UTF-16编码中会使用一个代理对表示，而在UTF-8中通常使用4个字节表示。
特定编码格式：如果已知字符串是使用特定的编码格式，如GB2312、GBK或GB18030，那么汉字通常占用2个字节。
利用Java API：可以使用Character类中的isHighSurrogate和isLowSurrogate方法来检测Unicode代理对，或者使用String类的codePointCount方法来获取字符串中的代码点数量，这有助于确定字符占用的字节数。