小白python入门 - 11. Python字符串——从文本表示到高效处理的全攻略

一、字符串是什么?

字符串是由零个或多个字符组成的有限序列,可包含:

  • 英文字母('hello'
  • 中文字符("你好"
  • 特殊符号(@#$
  • 甚至Emoji("🐱💻"

定义方式(3种常用语法):

s1 = '单引号包裹'    # 简单文本 
s2 = "双引号可包含'"  # 需包含单引号时更方便 
s3 = '''多行文本 
第二行自动换行
第三行'''

在 Python 程序中,我们把单个或多个字符用单引号或者双引号包裹起来,就可以表示一个字符串。字符串中的字符可以是特殊符号、英文字母、中文字符、日文的平假名或片假名、希腊字母、Emoji 字符(如:💩、🐷、🀄️)等。

s1 = 'hello, world!'
s2 = "你好,世界!❤️"
s3 = '''hello,
wonderful
world!'''
print(s1)
print(s2)
print(s3)

💡 计算机最初设计用于数值计算(如ENIAC计算机),但现代程序需大量处理文本信息,字符串因此成为编程核心数据类型。

二、特殊字符处理技巧

1. 转义字符:用\改变字符含义

我们可以在字符串中使用\(反斜杠)来表示转义,也就是说\后面的字符不再是它原来的意义,例如:\n不是代表字符\和字符n,而是表示换行;\t也不是代表字符\和字符t,而是表示制表符。所以如果字符串本身又包含了'"\这些特殊的字符,必须要通过\进行转义处理。例如要输出一个带单引号或反斜杠的字符串,需要用如下所示的方法。

print('It\'s time')  # 输出:It's time 
print("换行符\\n示例") # 输出:换行符\n示例 

2. 原始字符串(前缀r禁用转义):

Python 中有一种以rR开头的字符串,这种字符串被称为原始字符串,意思是字符串中的每个字符都是它本来的含义,没有所谓的转义字符。例如,在字符串'hello\n'中,\n表示换行;而在r'hello\n'中,\n不再表示换行,就是字符\和字符n。大家可以运行下面的代码,看看会输出什么。

print(r'C:\new_folder') # 输出:C:\new_folder 

说明:上面的变量s1中,\t\r\n都是转义字符。\t是制表符(table),\n是换行符(new line),\r是回车符(carriage return)相当于让输出回到了行首。对比一下两个print函数的输出,看看到底有什么区别!

3. Unicode编码直接表示字符:

Python 中还允许在\后面还可以跟一个八进制或者十六进制数来表示字符,例如\141\x61都代表小写字母a,前者是八进制的表示法,后者是十六进制的表示法。另外一种表示字符的方式是在\u后面跟 Unicode 字符编码,例如\u9a86\u660a代表的是中文“哈哈”。运行下面的代码,看看输出了什么。

s1 = '\141\142\143\x61\x62\x63'
print(s1)

三、字符串的16大核心操作

字符串的运算

Python 为字符串类型提供了丰富的运算符,其功能与列表运算符高度相似。例如:

  • + 运算符可实现字符串拼接
  • * 运算符支持字符串重复
  • innot in 运算符用于成员关系判断(检测子串是否存在)
  • [][:] 运算符支持索引访问与切片提取字符或子串
拼接和重复

下面的例子演示了使用+*运算符来实现字符串的拼接和重复操作。

s1 = 'hello' + ', ' + 'world'
print(s1)    # hello, world
s2 = '!' * 3
print(s2)    # !!!
s1 += s2
print(s1)    # hello, world!!!
s1 *= 2
print(s1)    # hello, world!!!hello, world!!!

* 运算符的字符串重复功能极具实用性。多数编程语言中,生成连续字符(如 10 个 'a')需显式书写 'aaaaaaaaaa',而 Python 可通过 'a' * 10 简洁实现。尽管小规模重复时差异不明显,但当重复次数达 100 次或 1000 次(如 'a' * 1000),运算符方案在代码可读性和编写效率上的优势将显著提升。

比较运算

字符串可直接通过比较运算符(==, !=, <, >, <=, >=)进行相等性判断与字典序比较。其本质基于字符的 Unicode 编码值(可通过 ord() 函数获取):

  1. 单字符比较:'A' < 'a'True,因 ord('A')=65 < ord('a')=97
  2. 多字符比较:'boy' < 'bad'False——首字符 'b' 相同,次字符 'o' (111) > 'a' (97),遵循逐字符编码比对规则。
s1 = 'a whole new world'
s2 = 'hello world'
print(s1 == s2)             # False
print(s1 < s2)              # True
print(s1 == 'hello world')  # False
print(s2 == 'hello world')  # True
print(s2 != 'Hello world')  # True
s3 = '哈哈'
print(ord('哈'))            # 21704
print(ord('哈'))            # 21704
s4 = '王大锤'
print(ord('王'))            # 29579
print(ord('大'))            # 22823
print(ord('锤'))            # 38180
print(s3 >= s4)             # False
print(s3 != s4)             # True
成员运算

innot in 作为成员运算符,用于检测字符串是否包含特定字符或子串,其行为与列表一致:返回布尔值 TrueFalse。 代码如下所示。

s1 = 'hello, world'
s2 = 'goodbye, world'
print('wo' in s1)      # True
print('wo' not in s2)  # False
print(s2 in s1)        # False
获取字符串长度

获取字符串长度跟获取列表元素个数一样,使用内置函数len,代码如下所示。

s = 'hello, world'
print(len(s))                 # 12
print(len('goodbye, world'))  # 14
索引和切片

字符串的索引与切片操作语法与列表、元组完全一致,因其同为有序序列,支持正向(如 [0])和反向(如 [-1])索引访问。但需注意:字符串是不可变类型,故允许通过索引读取字符(如 s[0]),但禁止通过索引赋值修改(如 s[0]='x' 将触发 TypeError)。

s = 'abc123456'
n = len(s)
print(s[0], s[-n])    # a a
print(s[n-1], s[-1])  # 6 6
print(s[2], s[-7])    # c c
print(s[5], s[-4])    # 3 3
print(s[2:5])         # c12
print(s[-7:-4])       # c12
print(s[2:])          # c123456
print(s[:2])          # ab
print(s[::2])         # ac246
print(s[::-1])        # 654321cba

需要再次提醒大家注意的是,在进行索引运算时,如果索引越界,会引发IndexError异常,错误提示信息为:string index out of range(字符串索引超出范围)。

字符的遍历

如果希望遍历字符串中的每个字符,可以使用for-in循环,有如下所示的两种方式。

方式一:

s = 'hello'
for i in range(len(s)):
    print(s[i])

方式二:

s = 'hello'
for elem in s:
    print(elem)

字符串的方法

在 Python 中,我们可以通过字符串类型自带的方法对字符串进行操作和处理,假设我们有名为foo的字符串,字符串有名为bar的方法,那么使用字符串方法的语法是:foo.bar(),这是一种通过对象引用调用对象方法的语法,跟前面使用列表方法的语法是一样的。

大小写相关操作

下面的代码演示了和字符串大小写变换相关的方法。

s1 = 'hello, world!'
# 字符串首字母大写
print(s1.capitalize())  # Hello, world!
# 字符串每个单词首字母大写
print(s1.title())       # Hello, World!
# 字符串变大写
print(s1.upper())       # HELLO, WORLD!
s2 = 'GOODBYE'
# 字符串变小写
print(s2.lower())       # goodbye
# 检查s1和s2的值
print(s1)               # hello, world
print(s2)               # GOODBYE

说明:由于字符串是不可变类型,使用字符串的方法对字符串进行操作会产生新的字符串,但是原来变量的值并没有发生变化。所以上面的代码中,当我们最后检查s1s2两个变量的值时,s1s2 的值并没有发生变化。

查找操作

如果想在一个字符串中从前向后查找有没有另外一个字符串,可以使用字符串的findindex方法。在使用findindex方法时还可以通过方法的参数来指定查找的范围,也就是查找不必从索引为0的位置开始。

s = 'hello, world!'
print(s.find('or'))      # 8
print(s.find('or', 9))   # -1
print(s.find('of'))      # -1
print(s.index('or'))     # 8
print(s.index('or', 9))  # ValueError: substring not found

说明find方法找不到指定的字符串会返回-1index方法找不到指定的字符串会引发ValueError错误。

findindex方法还有逆向查找(从后向前查找)的版本,分别是rfindrindex,代码如下所示。

s = 'hello world!'
print(s.find('o'))       # 4
print(s.rfind('o'))      # 7
print(s.rindex('o'))     # 7
# print(s.rindex('o', 8))  # ValueError: substring not found
性质判断

可以通过字符串的startswithendswith来判断字符串是否以某个字符串开头和结尾;还可以用is开头的方法判断字符串的特征,这些方法都返回布尔值,代码如下所示。

s1 = 'hello, world!'
print(s1.startswith('He'))   # False
print(s1.startswith('hel'))  # True
print(s1.endswith('!'))      # True
s2 = 'abc123456'
print(s2.isdigit())  # False
print(s2.isalpha())  # False
print(s2.isalnum())  # True

说明:上面的isdigit用来判断字符串是不是完全由数字构成的,isalpha用来判断字符串是不是完全由字母构成的,这里的字母指的是 Unicode 字符但不包含 Emoji 字符,isalnum用来判断字符串是不是由字母和数字构成的。

格式化

在 Python 中,字符串类型可以通过centerljustrjust方法做居中、左对齐和右对齐的处理。如果要在字符串的左侧补零,也可以使用zfill方法。

s = 'hello, world'
print(s.center(20, '*'))  # ****hello, world****
print(s.rjust(20))        #         hello, world
print(s.ljust(20, '~'))   # hello, world~~~~~~~~
print('33'.zfill(5))      # 00033
print('-33'.zfill(5))     # -0033

我们之前讲过,在用print函数输出字符串时,可以用下面的方式对字符串进行格式化。

a = 321
b = 123
print('%d * %d = %d' % (a, b, a * b))

当然,我们也可以用字符串的format方法来完成字符串的格式,代码如下所示。

a = 321
b = 123
print('{0} * {1} = {2}'.format(a, b, a * b))

从 Python 3.6 开始,格式化字符串还有更为简洁的书写方式,就是在字符串前加上f来格式化字符串,在这种以f打头的字符串中,{变量名}是一个占位符,会被变量对应的值将其替换掉,代码如下所示。

a = 321
b = 123
print(f'{a} * {b} = {a * b}')

如果需要进一步控制格式化语法中变量值的形式,可以参照下面的表格来进行字符串格式化操作。

变量值占位符格式化结果说明
3.1415926{:.2f}'3.14'保留小数点后两位
3.1415926{:+.2f}'+3.14'带符号保留小数点后两位
-1{:+.2f}'-1.00'带符号保留小数点后两位
3.1415926{:.0f}'3'不带小数
123{:0>10d}'0000000123'左边补0,补够10位
123{:x<10d}'123xxxxxxx'右边补x ,补够10位
123{:>10d}' 123'左边补空格,补够10位
123{:<10d}'123 '右边补空格,补够10位
123456789{:,}'123,456,789'逗号分隔格式
0.123{:.2%}'12.30%'百分比格式
123456789{:.2e}'1.23e+08'科学计数法格式
修剪操作

字符串的strip方法可以帮我们获得将原字符串修剪掉左右两端指定字符之后的字符串,默认是修剪空格字符。这个方法非常有实用价值,可以用来将用户输入时不小心键入的头尾空格等去掉,strip方法还有lstriprstrip两个版本,相信从名字大家已经猜出来这两个方法是做什么用的。

s1 = '   jackfrued@126.com  '
print(s1.strip())      # jackfrued@126.com
s2 = '~你好,世界~'
print(s2.lstrip('~'))  # 你好,世界~
print(s2.rstrip('~'))  # ~你好,世界
替换操作

如果希望用新的内容替换字符串中指定的内容,可以使用replace方法,代码如下所示。replace方法的第一个参数是被替换的内容,第二个参数是替换后的内容,还可以通过第三个参数指定替换的次数。

s = 'hello, good world'
print(s.replace('o', '@'))     # hell@, g@@d w@rld
print(s.replace('o', '@', 1))  # hell@, good world
拆分与合并

可以使用字符串的split方法将一个字符串拆分为多个字符串(放在一个列表中),也可以使用字符串的join方法将列表中的多个字符串连接成一个字符串,代码如下所示。

s = 'I love you'
words = s.split()
print(words)            # ['I', 'love', 'you']
print('~'.join(words))  # I~love~you

需要说明的是,split方法默认使用空格进行拆分,我们也可以指定其他的字符来拆分字符串,而且还可以指定最大拆分次数来控制拆分的效果,代码如下所示。

s = 'I#love#you#so#much'
words = s.split('#')
print(words)  # ['I', 'love', 'you', 'so', 'much']
words = s.split('#', 2)
print(words)  # ['I', 'love', 'you#so#much']
编码和解码

Python 中除了字符串str类型外,还有一种表示二进制数据的字节串类型(bytes)。所谓字节串,就是由零个或多个字节组成的有限序列。通过字符串的encode方法,我们可以按照某种编码方式将字符串编码为字节串,我们也可以使用字节串的decode方法,将字节串解码为字符串,代码如下所示。

a = '哈哈'
b = a.encode('utf-8')
c = a.encode('gbk')
print(b)                  # bb'\xe5\x93\x88\xe5\x93\x88'
print(c)                  # b'\xb9\xfe\xb9\xfe'
print(b.decode('utf-8'))  # 哈哈
print(c.decode('gbk'))    # 哈哈

注意,如果编码和解码的方式不一致,会导致乱码问题(无法再现原始的内容)或引发UnicodeDecodeError错误,导致程序崩溃。

其他方法

对于字符串类型来说,还有一个常用的操作是对字符串进行匹配检查,即检查字符串是否满足某种特定的模式。例如,一个网站对用户注册信息中用户名和邮箱的检查,就属于模式匹配检查。实现模式匹配检查的工具叫做正则表达式,Python 语言通过标准库中的re模块提供了对正则表达式的支持,我们会在后续的课程中为大家讲解这个知识点。

操作类型运算符/方法示例结果
拼接+'Hi' + '!'*3Hi!!!
重复*'a'*5aaaaa
成员判断in/not in'world' in sTrue
索引[索引]'Python'[2]'t'
切片[start:end:step]'Python'[1:4]'yth'
长度len()len("abc")3

重要特性:字符串不可变!执行s[0]='A'会报错,需通过拼接创建新字符串。

四:新手必学的10个字符串方法

  1. 大小写转换

    "hello".upper()       # "HELLO"
    "WORLD".lower()       # "world"
    "python title".title() # "Python Title"
    
  2. 查找与替换

    s = "hello world"
    s.find("wo")          # 6 (返回索引位置)
    s.replace("world", "Python") # "hello Python"
    
  3. 修剪空白

    "  text  ".strip()    # "text"
    "~~data~~".rstrip('~') # "~~data"
    
  4. 拆分与合并

    "a,b,c".split(',')    # ['a','b','c']
    '-'.join(['2023','08','01']) # "2023-08-01"
    
  5. 格式化输出(3种方式)

    # 1. %格式化 
    "%s今年%d岁" % ("小明", 12)  
    
    # 2. format()方法 
    "{}今年{}岁".format("小明", 12)
    
    # 3. f-string (推荐!)
    name = "小明"
    f"{name}今年{12}岁"  # "小明今年12岁"
    

总结:字符串学习路线图

  1. 基础:掌握定义方式+转义规则
  2. 操作:熟练拼接/切片/成员判断
  3. 进阶:活用split()/join()/format()
  4. 实战:文本清洗时多用strip()/replace()

编程哲学:字符串如同语言中的词汇,理解其操作就是掌握编程的"遣词造句"能力。当你能高效处理文本时,就打开了数据分析、网络爬虫、自动化办公的大门!

本文代码示例可直接复制到Python环境中运行,建议修改参数观察变化以加深理解!

https://docs.python.org/3/library/stdtypes.html#text-sequence-type-str

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值