字符串:编程时最重要的数据类型之一。
正则表达式:赋予开发者更多操作字符串的能力。
1、 Unicode和ASCII
1.1 概述
Unicode是ASCII字符编码的一个扩展,只不过在Windows中,用两个字节对其进行编码,也称为宽字符集(WideChars)。Unicode字符串有多种编码方式,常见的有UTF-8、UTF-16、UTF-32等,这些编码方式定义了如何将Unicode码点映射到字节序列。
1.2 Unicode和ASCII的关联
最开始,Internet上只有一种字符集----ANSI的ASCII字符集,它使用7bits来表示一个字符,总共表示128个字符,其中包括了英文字母、数字、标点符号等常用字符。
之后,进行了扩展,使用8bits表示一个字符,可以表示256个字符,主要在原来的7bits字符集的基础上加入了一些特殊符号。
再后来,各国语言的加入,ASCII已不能满足信息交流的需要,为了能够表示其他国家的文字,各国在ASCII的基础上制定了自己的字符集,即ANSI字符集(MBCS多字节字符系统),常见的GB-2312就是其中之一。
Unicode的诞生:不同ANSI编码之间互不兼容,为了统一所有文字的编码,Unicode应运而生。Unicode把所有语言都统一到一套编码里。
1.3 ASCII和Unicode的对比
(1)编码范围
- ASCII : 最早定义了128个字符,用于表示基本的英文字符、数字和一些控制字符。
- Unicode:是一个更大的字符集,旨