GO代码实现判断字符编码格式及编码格式转换(utf-8、gbk)

本文介绍了如何在Go语言中处理GBK和UTF-8编码。内容涉及GBK编码与GB2312、GB18030的关系,UTF-8的变字长编码方式,以及如何在Go中判断字符串编码类型和进行编码转换。
摘要由CSDN通过智能技术生成

引入

C/C++的实现请看[https://www.jianshu.com/p/a83d398e3606]
最近使用go开发http服务,在使用http进行通信时,发现接收报文中如果包含中文字符(非utf-8编码),直接使用go将二进制格式数据转换成字符串文本会出现乱码的情况。因为golang中的字符编码格式是utf-8,如果是其他类型的编码,例如gbk,那么直接转码后出现乱码也就理所当然了。


GBK编码格式

为了更好地说明GBK的编码方式,首先在这里先说明一下ASCII码,GB2312, GBK, GB18030的兼容性关系:
各种编码兼容关系.png

ASCII编码使用一个字节的低7位(范围0-127)来表示共128个字符,最高位为0,即 0XXX_XXXX

GB2312为了能表示更多字符,使用单字节和双字节来进行编码,单个字节编码与ASCII完全一样,也就兼容了ASCII码,双字节编码高低字节范围都是0xA1-0xFE(范围0xA1A1 - 0xFEFE )。要注意的是该范围的并不是每一个码位都编有字符,GB2312只编码汉字6763个和非汉字图形字符682个。
GB2312具体编码表

GBK编码同样使用单字节和双字节来进行编码,单字节也同样采用ASCII的编码,双字节GBK编码范围在0x8140 - 0xFEFE之间,细心的人一定发现了GBK编码范围覆盖了GB2312的编码范围。实际上,GB2312的所有双字节字符编码在GBK中也完全一样,这样就实现了GBK对GB2312的兼容。GBK除了包含GB2312的所有字符外,在其编码范围内编码了更多的字符。按照前面提到的,GBK首字节在 81-FE之间 (共126个),尾字节在 40-FE 之间(剔除xx7F后共190个),总计 可以有126*190 = 23940 个码位,除掉不编码的码位后共收入 21886 个汉字和图形符号,其中汉字(包括部首和构件)21003 个,图形符号 883 个。而GB18030则在兼容GBK的基础上使用四个字节来达到扩展编码的目的,与本文要介绍的内容关联不大,有兴趣的话可以自己了解。
GBK具体编码表
GBK编码范围.png


utf-8编码格式

utf-8使用变字长方式(1到6个字节)来进行编码。
对于某一个字符的UTF-8编码,如果只有一个字节则其最高二进制位为0;如果是多字节,其第一个字节从最高位开始,连续的二进制位值为1的个数决定了其编码的位数,其余各字节均以10开头。具体表示如下:
0XXX_XXXX
110X_XXXX 10XX_XXXX
1110_XXXX 10XX_XXXX 10XX_XXXX
1111_0XXX 10XX_XXXX 10XX_XXXX 10XX_XXXX
1111_10XX 10XX_XXXX 10XX_XXXX 10XX_XXXX 10XX_XXXX
1111_110X 10XX_XXXX 10XX_XXXX 10XX_XXXX 10XX_XXXX 10XX_XXXX


go判断字符串是否是gbk:

func isGBK(data []byte) bool {
   
	length := len(data)
	var i int = 0
	for i < length {
   
		if data[i] <= 0x7f {
   
			//编码0~127,只有一个字节的编码,兼容ASCII码
			i++
			continue
		} else {
   
			//大于127的使用双字节编码,落在gbk编码范围内的字符
			if  data[i] >= 0x81 &&</
  • 4
    点赞
  • 16
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值