Java中utf-8占几个字节

占2个字节的:〇

占3个字节的:基本等同于GBK,含21000多个汉字

占4个字节的:中日韩超大字符集里面的汉字,有5万多个

一个utf8数字占1个字节

一个utf8英文字母占1个字节

 

在查找 UTF-8 编码资料时发现,很多的帖子说的 UTF-8 编码里,一个汉字占用3个字节,有的还做了个证明

方法1:创建一个没有BOM的UTF-8编码的文本文件,里面保存了几个汉字,然后查看文件的大小。我觉得这样的证明没有一点说服力,因为 UTF-8 是变长的,1-6个字节,少量的汉字检测是不能说明所有的汉字都是的。

方法2:

String s = "中国";
byte[] bs = s.getBytes("UTF-8");
System.out.println(bs.length);


后来我又查看了字符映射表-汉语,找到了正确的答案,少数是汉字每个占用3个字节,多数占用4个字节。

占用3个字节的范围

U+2E80 - U+2EF3 : 0xE2 0xBA 0x80 - 0xE2 0xBB 0xB3      共 115 个
U+2F00 - U+2FD5 : 0xE2 0xBC 0x80 - 0xE2 0xBF 0x95      共 213 个
U+3005 - U+3029 : 0xE3 0x80 0x85 - 0xE3 0x80 0xA9      共 36 个
U+3038 - U+4DB5 : 0xE3 0x80 0xB8 - 0xE4 0xB6 0xB5      共 7549 个
U+4E00 - U+FA6A : 0xE4 0xB8 0x80 - 0xEF 0xA9 0xAA      共 44138 个
U+FA70 - U+FAD9 : 0xEF 0xA9 0xB0 - 0xEF 0xAB 0x99      共 105 个

合计: 52156 个

占用4个字节的范围

U+20000 - U+2FA1D : 0xF0 0xA0 0x80 0x80 - 0xF0 0xAF 0xA8 0x9D      共 64029 个

合计: 64029 个

参考:http://www.ibm.com/developerworks/cn/java/j-lo-chinesecoding/

Java,有多种方法可以检查文件的编码是否为UTF-8,以下是几个常见的示例: **1. 使用BOM(Byte Order Mark)**: UTF-8文件通常会在开头有一个BOM(Byte Order Mark),你可以读取前几个字节来判断。例如: ```java InputStream is = new FileInputStream(file); int bom = is.read(); is.close(); if (bom == 0xEF && bom == 0xBB && bom == 0xBF) { System.out.println("可能是UTF-8"); } ``` 但这种方法并不完全准确,因为有些工具不会添加BOM,比如Windows记事本生成的文本文件。 **2. 使用`Files.readAllBytes()`和`Charset.availableCharsets()`**: 遍历所有可用的字符集,找到最匹配的编码: ```java byte[] bytes = Files.readAllBytes(Paths.get(file)); for (Charset charset : Charset.availableCharsets()) { try { if (charset.decode(new ByteBuffer(bytes)).toString().equals("UTF-8")) { System.out.println("可能是UTF-8"); break; } } catch (UnsupportedEncodingException e) { // 忽略无法解码的情况 } } ``` **3. 使用`BufferedReader`和`InputStreamReader`**: 逐行读取,观察字符是否能正确显示: ```java try (BufferedReader br = new BufferedReader(new InputStreamReader(new FileInputStream(file), "UTF-8"))) { String line = br.readLine(); if (line != null && !line.isEmpty()) { // 如果第一行可以正常解析,那么可能就是UTF-8 System.out.println("可能是UTF-8"); } } catch (IOException e) { // 处理异常 } ``` 请注意,以上方法都需要处理可能出现的异常,并且并不是绝对准确,因为可能存在其他编码看起来与UTF-8相似,尤其是在数据损坏的情况下。最好结合实际需求和场景进行选择。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值