1 字符串的定义-所谓字符串,就是由零个或多个字符组成的有限序列
s1 = 'hello, world!' s2 = "你好,世界!" print(s1, s2) # 以三个双引号或单引号开头的字符串可以折行 s3 = ''' hello, world! ''' print(s3, end='')
提示:print
函数中的end=''
表示输出后不换行,即将默认的结束符\n
(换行符)更换为''
(空字符)。
1.1 转义字符和原始字符串
可以在字符串中使用\
(反斜杠)来表示转义,也就是说\
后面的字符不再是它原来的意义,例如:\n
不是代表反斜杠和字符n
,而是表示换行;\t
也不是代表反斜杠和字符t
,而是表示制表符。所以如果字符串本身又包含了'
、"
、\
这些特殊的字符,必须要通过\
进行转义处理。
s1 = '\'hello, world!\'' print(s1) s2 = '\\hello, world!\\' print(s2)
# 字符串s1中\t是制表符,\n是换行符 s1 = '\time up \now' print(s1) # 字符串s2中没有转义字符,每个字符都是原始含义 s2 = r'\time up \now' print(s2)
1.2 字符串的运算
Python为字符串类型提供了非常丰富的运算符,我们可以使用+
运算符来实现字符串的拼接,可以使用*
运算符来重复一个字符串的内容,可以使用in
和not in
来判断一个字符串是否包含另外一个字符串,我们也可以用[]
和[:]
运算符从字符串取出某个字符或某些字符。
1.2.1 下面的例子演示了使用+
和*
运算符来实现字符串的拼接和重复操作。
s1 = 'hello' + ' ' + 'world' print(s1) # hello world s2 = '!' * 3 print(s2) # !!! s1 += s2 # s1 = s1 + s2 print(s1) # hello world!!! s1 *= 2 # s1 = s1 * 2 print(s1) # hello world!!!hello world!!!
1.2.2 比较运算 ord()可以找到字符所对应的编码
s1 = 'a whole new world' s2 = 'hello world' print(s1 == s2, s1 < s2) # False True print(s2 == 'hello world') # True print(s2 == 'Hello world') # False print(s2 != 'Hello world') # True s3 = '骆昊' print(ord('骆'), ord('昊')) # 39558 26122 s4 = '王大锤' print(ord('王'), ord('大'), ord('锤')) # 29579 22823 38180 print(s3 > s4, s3 <= s4) # True False
1.2.3 字符串的比较运算比较的是字符串的内容,Python中还有一个is
运算符(身份运算符),如果用is
来比较两个字符串,它比较的是两个变量对应的字符串对象的内存地址(不理解先跳过),简单的说就是两个变量是否对应内存中的同一个字符串。看看下面的代码就比较清楚is
运算符的作用了。
s1 = 'hello world'
s2 = 'hello world'
s3 = s2
# 比较字符串的内容
print(s1 == s2, s2 == s3) # True True
# 比较字符串的内存地址
print(s1 is s2, s2 is s3) # False True
1.3 成员运算
Python中可以用in
和not in
判断一个字符串中是否存在另外一个字符或字符串,in
和not in
运算通常称为成员运算,会产生布尔值True
或False
,代码如下所示。
s1 = 'hello, world' print('wo' in s1) # True s2 = 'goodbye' print(s2 in s1) # False
1.4 获取字符串长度
获取字符串长度没有直接的运算符,而是使用内置函数len
,我们在上节课的提到过这个内置函数,代码如下所示。
s = 'hello, world' print(len(s)) # 12 print(len('goodbye, world')) # 14
1.5 索引和切片
如果希望从字符串中取出某个字符,我们可以对字符串进行索引运算,运算符是[n]
,其中n
是一个整数,假设字符串的长度为N
,那么n
可以是从0
到N-1
的整数,其中0
是字符串中第一个字符的索引,而N-1
是字符串中最后一个字符的索引,通常称之为正向索引;在Python中,字符串的索引也可以是从-1
到-N
的整数,其中-1
是最后一个字符的索引,而-N
则是第一个字符的索引,通常称之为负向索引。注意,因为字符串是不可变类型,所以不能通过索引运算修改字符串中的字符。
s = 'abc123456' N = len(s) # 获取第一个字符 print(s[0], s[-N]) # a a # 获取最后一个字符 print(s[N-1], s[-1]) # 6 6 # 获取索引为2或-7的字符 print(s[2], s[-7]) # c c # 获取索引为5和-4的字符 print(s[5], s[-4]) # 3 3
取出字符串中的字符
s = 'abc123456' # i=2, j=5, k=1的正向切片操作 print(s[2:5]) # c12 # i=-7, j=-4, k=1的正向切片操作 print(s[-7:-4]) # c12 # i=2, j=9, k=1的正向切片操作 print(s[2:]) # c123456 # i=-7, j=9, k=1的正向切片操作 print(s[-7:]) # c123456 # i=2, j=9, k=2的正向切片操作 print(s[2::2]) # c246 # i=-7, j=9, k=2的正向切片操作 print(s[-7::2]) # c246 # i=0, j=9, k=2的正向切片操作 print(s[::2]) # ac246 # i=1, j=-1, k=2的正向切片操作 print(s[1:-1:2]) # b135 # i=7, j=1, k=-1的负向切片操作 print(s[7:1:-1]) # 54321c # i=-2, j=-8, k=-1的负向切片操作 print(s[-2:-8:-1]) # 54321c # i=7, j=-10, k=-1的负向切片操作 print(s[7::-1]) # 54321cba # i=-1, j=1, k=-1的负向切片操作 print(s[:1:-1]) # 654321c # i=0, j=9, k=1的正向切片 print(s[:]) # abc123456 # i=0, j=9, k=2的正向切片 print(s[::2]) # ac246 # i=-1, j=-10, k=-1的负向切片 print(s[::-1]) # 654321cba # i=-1, j=-10, k=-2的负向切片 print(s[::-2]) # 642ca
1.6 循环遍历每个字符
如果希望从字符串中取出每个字符,可以使用for
循环对字符串进行遍历,有两种方式。
方式1:
s1 = 'hello' for index in range(len(s1)): print(s1[index])
方式2:
s1 = 'hello' for ch in s1: print(ch)
1.7 大小写相关操作
s1 = 'hello, world!' # 使用capitalize方法获得字符串首字母大写后的字符串 print(s1.capitalize()) # Hello, world! # 使用title方法获得字符串每个单词首字母大写后的字符串 print(s1.title()) # Hello, World! # 使用upper方法获得字符串大写后的字符串 print(s1.upper()) # HELLO, WORLD! s2 = 'GOODBYE' # 使用lower方法获得字符串小写后的字符串 print(s2.lower()) # goodbye
1.8 字符串的查找操作
如果想在一个字符串中从前向后查找有没有另外一个字符串,可以使用字符串的find
或index
方法。
s = 'hello, world!' # find方法从字符串中查找另一个字符串所在的位置 # 找到了返回字符串中另一个字符串首字符的索引 print(s.find('or')) # 8 # 找不到返回-1 print(s.find('shit')) # -1 # index方法与find方法类似 # 找到了返回字符串中另一个字符串首字符的索引 print(s.index('or')) # 8 # 找不到引发异常 print(s.index('shit')) # ValueError: substring not found
在使用find
和index
方法时还可以通过方法的参数来指定查找的范围,也就是查找不必从索引为0
的位置开始。find
和index
方法还有逆向查找(从后向前查找)的版本,分别是rfind
和rindex
,代码如下所示。
s = 'hello good world!' # 从前向后查找字符o出现的位置(相当于第一次出现) print(s.find('o')) # 4 # 从索引为5的位置开始查找字符o出现的位置 print(s.find('o', 5)) # 7 # 从后向前查找字符o出现的位置(相当于最后一次出现) print(s.rfind('o')) # 12
1.9 性质判断
可以通过字符串的startswith
、endswith
来判断字符串是否以某个字符串开头和结尾;还可以用is
开头的方法判断字符串的特征,这些方法都返回布尔值,代码如下所示。
s1 = 'hello, world!' # startwith方法检查字符串是否以指定的字符串开头返回布尔值 print(s1.startswith('He')) # False print(s1.startswith('hel')) # True # endswith方法检查字符串是否以指定的字符串结尾返回布尔值 print(s1.endswith('!')) # True s2 = 'abc123456' # isdigit方法检查字符串是否由数字构成返回布尔值 print(s2.isdigit()) # False # isalpha方法检查字符串是否以字母构成返回布尔值 print(s2.isalpha()) # False # isalnum方法检查字符串是否以数字和字母构成返回布尔值 print(s2.isalnum()) # True
1.10 格式化字符串
在Python中,字符串类型可以通过center
、ljust
、rjust
方法做居中、左对齐和右对齐的处理。如果要在字符串的左侧补零,也可以使用zfill
方法
s = 'hello, world' # center方法以宽度20将字符串居中并在两侧填充* print(s.center(20, '*')) # ****hello, world**** # rjust方法以宽度20将字符串右对齐并在左侧填充空格 print(s.rjust(20)) # hello, world # ljust方法以宽度20将字符串左对齐并在右侧填充~ print(s.ljust(20, '~')) # hello, world~~~~~~~~ # 在字符串的左侧补零 print('33'.zfill(5)) # 00033 print('-33'.zfill(5)) # -0033
我们之前讲过,在用print
函数输出字符串时,可以用下面的方式对字符串进行格式化。
a = 321
b = 123
print('%d * %d = %d' % (a, b, a * b))
当然,我们也可以用字符串的方法来完成字符串的格式,代码如下所示。
a = 321
b = 123
print('{0} * {1} = {2}'.format(a, b, a * b))
1.11 占位符的格式化操作
1.12 修剪操作
字符串的strip
方法可以帮我们获得将原字符串修剪掉左右两端空格之后的字符串。这个方法非常有实用价值,通常用来将用户输入中因为不小心键入的头尾空格去掉,strip
方法还有lstrip
和rstrip
两个版本,相信从名字大家已经猜出来这两个方法是做什么用的。
s = ' jackfrued@126.com \t\r\n' # strip方法获得字符串修剪左右两侧空格之后的字符串 print(s.strip()) # jackfrued@126.com
1.13 替换操作
如果希望用新的内容替换字符串中指定的内容,可以使用replace
方法,代码如下所示。replace
方法的第一个参数是被替换的内容,第二个参数是替换后的内容,还可以通过第三个参数指定替换的次数。
s = 'hello, world' print(s.replace('o', '@')) # hell@, w@rld print(s.replace('o', '@', 1)) # hell@, world
1.14 拆分/合并操作
可以使用字符串的split
方法将一个字符串拆分为多个字符串(放在一个列表中),也可以使用字符串的join
方法将列表中的多个字符串连接成一个字符串,代码如下所示。
s = 'I#love#you#so#much' words = s.split('#') print(words) # ['I', 'love', 'you', 'so', 'much'] words = s.split('#', 3) print(words) # ['I', 'love', 'you', 'so#much']
1.15 编码/解码操作
Python中除了字符串str
类型外,还有一种表示二进制数据的字节串类型(bytes
)。所谓字节串,就是由零个或多个字节组成的有限序列。通过字符串的encode
方法,我们可以按照某种编码方式将字符串编码为字节串,我们也可以使用字节串的decode
方法,将字节串解码为字符串,代码如下所示。
a = '骆昊' b = a.encode('utf-8') c = a.encode('gbk') print(b, c) # b'\xe9\xaa\x86\xe6\x98\x8a' b'\xc2\xe6\xea\xbb' print(b.decode('utf-8')) print(c.decode('gbk'))