字节与字符串，十六制字符串

最新推荐文章于 2024-04-05 20:23:04 发布

yunyun0220

最新推荐文章于 2024-04-05 20:23:04 发布

阅读量1.5k

点赞数

分类专栏：基础知识文章标签：字节字符串转化

原文链接：https://www.cnblogs.com/Free-Thinker/p/10007121.html

版权

基础知识专栏收录该内容

3 篇文章 0 订阅

订阅专栏

一、编码

同一个字符在不同的编码下会被编成不同长度的编码，比如：

ACSII,每个字符对应一个字节，实际上只使用了7位，从00h-7Fh。只能表达128个字符。

GB2312,中文的一种编码，每个字符使用两个字节表示。

UTF-8, 可以表达所有unicode字符，每个字符可以用1-3个字节表示。

UTF-16, 可以表达所有unicode字符，每个字符可以用1-2个16位整数表示。

UTF-32, 可以表达所有unicode字符，每个字符可以用1个32位整数表示。

目前Windows的内核已经采用Unicode编码，这样在内核上可以支持全世界所有的语言文字。但是由于现有的大量程序和文档都采用了某种特定语言的编码，例如gb2312，Windows不可能不支持现有的编码，而全部改用Unicode。

Windows使用上面表格所示的代码页(code page)来适应各个国家和地区。Windows使用默认代码页来表示当前操作系统的使用的语言，这可以在控制面板的“区域和语言选项”中选择。一般中文windows操作系统，选择“中文（中国）”，这样设置，windows的默认代码页就是936，即gb2312。

Windows按照当前的缺省代码页去解释文本文件里的字节流。缺省代码页可以通过控制面板的区域选项设置。记事本的另存为中有一项ANSI，其实就是按照缺省代码页的编码方法保存。

Windows的内码是Unicode，它在技术上可以同时支持多个代码页。只要文件能说明自己使用什么编码，用户又安装了对应的代码页，Windows就能正确显示，例如在HTML文件中就可以指定charset。

字节序

UTF-8是单字节的编码，不用考虑字节顺序，但是UTF-16和UTF-32是16位和32位的编码，每个编码内部都有个字节顺序的问题。比如字符”A” (U+0041)，在序列化时是”00”在前还是”41”在前，这就有两种可能。

UTF-16 big-endian byte order: 00 41

UTF-16 little-endian byte order: 41 00

规范规定了一个可选的方案，就是在编码前导几个字符放上本身不是UTF可能编码的前导编码来帮助判断识别。

UTF-8: EF BB BF

UTF-16 big-endian byte order: FE FF

UTF-16 little-endian byte order: FF FE

UTF-32 big-endian byte order: 00 00 FE FF

UTF-32 little-endian byte order: FF FE 00 00

二、需要把string转换为byte[]使用的场景

任何需要把string序列化处理都需要这种转换，比如：

需要把string保存到文件中，必须把string转换成一个有序的字节流，以便系统在硬盘上做物理保存。

对string做加密操作时，加密算法是针对字节进行处理，这时也需要把string转换成字节流以便加密算法对数据进行处理。

String到字节流的转换涉及到使用何种编码，使用不同的编码得到的字节码不同，再从字节码做反操作恢复成string，必须使用编码时使用的编码或者兼容的编码，否则结果就是乱码。

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。