一:编码
大家在接收别人文件是应该都有碰到过乱码的情况,这个时候需要做的是讲文件编码格式进行切换成别人使用的编码格式就可以看到原来的文件里写的是什么。
ASCII格式
ASCII格式这个编码是指0-127的内容,0x20以下的字节状态是控制码,用来控制一些输入和输出比如换行等情况,后面就包含了空格,标定符号,数字和大小写字母等这些扩充到127号。
非ASCII编码
英语使用128个字符能够满足条件,但是其他语言不能满足,就会使用最高位参与编码。将这个扩充到256个符号编码。比如GB2312编码
Unicode
Unicode就像是一个集合,统一编码,统一所有的字符集合,这个包含了100多万个符号。
每种编码中一个字符所占的字节数
在ASSIC码中 每一个字符统一都需要8个bit来存储
一位=1bit;1个字节=1bytes=8bit
在Unicode 万国码中 每一个字符统一占两个字节即16个bit
支持中文的第一张表叫做 GB2312 (1980 gb2312 6700+个中文;1995 gbk1.0 20000个中文;2000 gb18030 27000个中文 ;big5 台湾)
UTF-8 = unicode 的扩展集,可变长的字符编码集 在UTF-8中一个字符占3个字节
- GBK是在国家标准GB2312基础上扩容后兼容GB2312的标准(好像