c++中的字符集与中文

最新推荐文章于 2024-05-07 18:16:30 发布

weixin_34293059

最新推荐文章于 2024-05-07 18:16:30 发布

阅读量400

点赞数

文章标签： c/c++

就非西欧字符而言，比如中国以及港澳台，在任何编程语言的开发中都不得不考虑字符集及其表示。在c++中，对于超过1个字节的字符，有两种方式可以表示：

1、多字节表示法；通常用于存储（空间效率考虑）。

2、宽字符表示法，通常用于程序中（性能考虑）。

目前最主要或最常见的字符集应该来说包括：

ASCII，7位。

ISO-Latin-1/ISO-8859-1，8位。

UCS-2，16位定长。

UTF-8，8-32位变长。

UTF-16，16或32位变长。

UCS-4/UTF-32，32位定长。

对于特定的字符，各编码格式所占的字节数和编码值如下：

说到UTF-16/UTF-32，不得不说BOM（byte order mark），它的作用跟网络编程中的字节码顺序概念一样，用于标识使用big endian或者little endian。

无BOM的字节流开始：

带BOM的字节流开始：

在c++中，并没有原生支持GBK/GB18050/UTF-8的编码，如下：

基本上广泛用的就是char和wchar_t。

对于常规控制台输入的，基本上网上很多demo了，所以接下去来看下从文件或者网络socket端过来的utf-8或者GBK编码如何处理的。

weixin_34293059

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
c++中的字符集与中文

就非西欧字符而言，比如中国以及港澳台，在任何编程语言的开发中都不得不考虑字符集及其表示。在c++中，对于超过1个字节的字符，有两种方式可以表示：1、多字节表示法；通常用于存储（空间效率考虑）。2、宽字符表示法，通常用于程序中（性能考虑）。目前最主要或最常见的字符集应该来说包括：ASCII，7位。ISO-Latin-1/ISO-8859-1，8位。UCS-2，16位定长。UTF-8...
复制链接

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。