读写文件是最常见的IO操作,python内置了读写文件的函数,用法和c是兼容的。
读写文件前,我们必须了解一下:
在磁盘上读写文件的功能都是由操作系统提供的,现在操作系统不允许普通的程序直接操作磁盘,
所以读写文件就是请求操作系统打开一个文件对象(文件描述),然后,通过操作系统提供的接口从这个文件对象中读取数据(读文件),或者把数据写入这个文件对象(写文件)。
读文件
语法:
f = open(path,mode,encoding,error)
f:打开的文件对象
path:请求打开文件的路径
mode:模式,r,w(写),a(追加)
encoding:编码格式
error:若出现编码错误的,处理方式
f.read()
功能:一次性读取全部文件. 4G
f.read(size)
功能:一次性读取size个字节.
f.readlines()
功能:按行读取,读取内容以列表方式返回.
f.readline()
功能:一次性读取一行
注意:当遇到一些配置文件的时候,我们通常采用按行读取的方式
要以读文件的模式打开一个文件对象,使用 python 内置的 open() 函数,传入文件名和标识符:
>>> f = open('/user/demo/test.txt','r')
标识符 ‘r’ 表示读,这样,我们就成功地打开了一个文件
如果文件不存在,,open() 函数就会抛出一个 IOError 的错误,并且会给出详细的错误码和信息,告诉你文件不存在.
>>> f=open('/Users/michael/notfound.txt', 'r')
Traceback (most recent call last):
File "<stdin>", line 1, in <module>
FileNotFoundError: [Errno 2] No such file or directory: '/Users/michael/notfound.txt'
如果文件打开成功,接下来,调用 read() 方法可以一次性读取文件的全部内容,python把内容读取到内存,用一个str对象表示
>>> f.read()
'hello world!'
最后一步调用close()方法关闭文件,文件使用完毕之后必须关闭,因为文件对象会占用操作系统的资源,并且操作系统同一时间能打开的文件数量也是有限制的.
>>> f.close()
由于文件读写都有可能产生IOError,一旦出错,后面的f.close()就不会调用,所以,为了保证文件是否执行出错都能够正确的关闭文件,我们可以使用try … finally来实现.
try:
f = open('/path/demo/file','r')
print(f.read())
finally:
if f:
f.close()
但是每次都这么写实在太繁琐,所以,python中将close这个方法进行了封装,给我们提供了一个新的语句引入了with语句来自动帮我们调用close()方法:
with open(path,mode,encoding,errors) as 文件对象名:
pass
注意:在此语句块中,我们无需调用close的方法,它已经帮我们将此方法进行了封装.
所有的文件操作要写到此语句块中.
例如:
with open('/path/demo/file', 'r') as f:
print(f.read())
这和前面的try…finally是一样的,但是代码更加简洁,并且不必调用f.close()方法.
注意: 使用read()会一次性读取文件的全部内容。
如果你的文件特别大,比如说有5G,那么你的内存就爆了。
所以,为了保险起见,我们可以反复调用read(size)方法,每次最多读取size个字节内容,另外调用readline()可以每次读取一行内容,调用readlines()一次性读取所有的内容,并按行返回list,因此,要根据需要决定怎么调用.
如果文件很小,read()一次读取最方便,如果不能确定文件大小,反复调用read(size)比较保险,如果是配置文件,调用readlines()最方便
for line in f.readlines():
#把末尾的'\n'删掉
print(line.strip())
例如:
path = r"E:\python\1.py"
try:
f = open(path,"r",encoding="utf-8",errors="ignore")
while True:
str1 = f.read(100) #每100个字节读取
print(str1,end="")
if str1 == "": #当为空时(文件读取完毕),结束循环
break
print(f.readline())
except:
pass
finally:
if f: #文件打开完毕,结束读取
f.close()
path = r"E:\python\1.py"
try:
f = open(path,"r",encoding="utf-8",errors="ignore")
while True:
str1 = f.readline() #按行读取,一次读取一行
if str1=="":
break #当为空时(读取完毕),结束循环
print(str1,end="")
except:
pass
finally:
if f: #文件打开完毕,结束读取
f.close()
二进制文件
前面讲的默认都是读取文本文件,并且是 UTF-8 编码的文本文件,要读取二进制文件,比如图片,视频等等,用’rb’模式打开文件即可
f = open('/users/demo/test.jpg',"rb")
f.read()
b'\xff\xd8\xff\xe1\x00\x18Exif\x00\x00...' # 十六进制表示的字节
语法:
with open(path,"rb") as f:
f.read()
读取图片
path= r"E:\python\img2.jpg"
with open(path,"rb") as f:
print(f.read()) #返回的是一串字符串类型.即,将文件(这里是图片),转为一串字符
字符编码
要读取非UTF-8编码的文本文件,需要给open()函数传入encoding参数,例如,读取GBK编码的文件:
>>> f = open('/user/demo/gbk.txt','r',encoding = 'gbk')
>>> f.read()
'测试'
遇到有些编码不规范的文件,你可能遇到UnicodeDecodeError,因为在文本文件中可能夹杂了一些非法编码的字符,遇到这种情况,open()函数还接收一个error参数,表示如果遇到编码错误之后如何处理,最简单的办法就是直接忽略.
>>> f = open('/users/demo/gbk.txt','r',encoding = 'gbk',errors = 'ignore')
写文件
写文件和读文件都是一样的,唯一的区别就是调用open()函数时,传入标识符’w’或者’wb’表示写文件或写二进制文件:
>>> f = open("/users/demo/test.txt",'w')
>>> f.write('hello, world!')
>>> f.close()
可以反复调用write()来写入文件,但是务必要调用f.close()来关闭文件.
当我们写入文件时,操作系统往往不会立刻把数据写入磁盘,而是放到内存缓存起来,空闲的时候再慢慢写入,
只有调用close()方法时,操作系统才保证把没有写入的数据全部写入磁盘,忘记调用close()的后果是数据可能只写了一部分到磁盘,剩余的丢失了,所以,还是使用with语句来的保险:
with open('/users/demo/test.txt', 'w') as f:
f.write('hello, world')
要写入特定编码的文本文件,请给open()函数传入encoding参数,将字符串自动转成指定编码.
将一串十六进制表示的字节转为文件(这里是图片)
str1 = b'\xff\xd8\xff\xe0\x00\x10JFIF\x00\x01\x01\x01\x00H\x00H\x00\x00\xff\xdb\x00C\x00\x05\x03\x04\x04\x04\x03\.....'
with open("img5.png","wb") as f:
#这里没有img5.png,所以,代码直接创了一个,如果本身有这个文件(图片),则覆盖原有的
f.write(str1)
以’w’模式写入文件时,如果文件已经存在,直接覆盖(相当于删掉后新写入一个文件),如果希望追加到文件的末尾,可以传入’a’以追加模式写入.
with open('/users/demo/test.txt', 'a') as f:
f.write('hello, world')
循环读写
1.打开一个图片,将图片的信息一次性读取1024字节
2.读取多少,写入多少.
[图片另存为的功能,写成函数的形式]
def readandwrite(path1,path2):
with open(path1,"rb") as f1:
with open(path2,"wb") as f2:
while True:
str1 = f1.read(1024)
if not str1:
break
f2.write(str1)
readandwrite("img2.jpg","img3.jpg")
将对象写入到文件,再读出来
dict1 = {1:"1",2:"2"}
with open("demo.txt","a",encoding="utf-8") as f:
#此时不存在demo.txt文件,代码自动创建 "a"为追加
f.write(str(dict1)+"\n")
#将dict1转换成字符串后写入文件 "\n"换行
with open("demo.txt","r") as f1: #将demo.txt读出来
for line in f1.readlines(): #用for循环遍历每一行,
res = eval(line) #line为字符串类型,用eval转换为字典类型
print(res)
print(type(res))
写入普通文件
语法:
with open(path,"w",encoding,errors) as f:
f.write(str)
errors 默认strict[严格的],若出现编码问题则直接报错
errors设置为"ignore" [忽略编码错误],若出现问题则忽略错误,有可能文件会发生乱码
w:若此路径存在,则覆盖此文件,若不存在,则创建文件
a:此路径存在,则追加,不存在,则创建文件
f.write() 写入的数据类型一定要是字符串类型
f = open()
f.write()
f.close()
dict1 = {1:"1",2:"2"}
class Student():
def __init__(self,name,age): #初始化定义name和age属性 *** 二 ****
self.name = name
self.age = age
def __str__(self):
return "%s-%d"%(self.name,self.age)#重写str函数,将name和age属性以 lili-19 形式返回 *** 七 ****
stu = Student("lili",19) # *** 一 ****
'''
将对象写入到文件,再读出来.
'''
def stu2dict(stu):
# 自定义stu2dict 将类转为字典的方法 ,传入上面的stu类,以字典 {'name': 'lili', 'age': 19} 的形式返回 *** 三 ****
return {"name":stu.name,"age":stu.age}
def dict2stu(d1):
# 自定义dict2stu 将字典转化回类的方法 ,传入转化回来的字典,以 lili,19 的形式返回 *** 六 ****
return Student(d1["name"],d1["age"])
with open("demo.txt","a",encoding="utf-8") as f: #写入 *** 四 ****
f.write(str(stu2dict(stu))+"\n") #将字典stu2dict转为字符串写入二进制文件demo.txt
with open("demo.txt","r") as f1: #将demo.txt这二进制文件读出 *** 五 ****
for line in f1.readlines(): #遍历每一行
res = eval(line) #line为字符串类型,用eval转换回原有的字典类型
stu = dict2stu(res) #将字典类型转化回类
print(stu) #将原有数据输出
print(type(stu))
StringIO 与 BytesIO
有时候,我们可能不只是读写我们的文件,有些时候我们也需要在内存中读写一些东西,
这时候我们可以用到StringIO,ByteIO。
StringIO:在内存中读写普通字符串
ByteIO:在内存中读写的二进制的字符串
StringIO
stirngIO顾名思义就是在内存中读写str
要把str写入StringIO,我们需要先创建一个StringIO,然后,像文件一样写入即可:
from io import StringIO
f = StringIO()
f.write("hello")
f.write(" ")
f.write('world')
#获取写入后的str
print(f.getvalue())
# 输出结果 hello world
要读取StringIO,可以用一个str初始化StringIO,然后,像读文件一样读取:
from io import StringIO
f = StringIO("Hello\nHi\nGoodBye!")
while True:
s = f.readline()
if s == '':
break
print(s.trip())
#
Hello!
Hi!
Goodbye!
上面的还可以通过 read() 的方式换行输出
strio2 = StringIO("hello\ngood\n\n \nnice")
print(strio2.read())# 换行输出
# 输出结果
hello
good
nice
使用 readlines 输出的是列表,元素用逗号隔开
strio2 = StringIO("hello\ngood\n\n \nnice")
print(strio2.readlines()) #输出列表,元素用逗号隔开
print(type(strio2.readlines()))
# 输出结果
['hello\n', 'good\n', '\n', ' \n', 'nice']
<class 'list'>
BytesIO
StringIO操作的只能是str,如果要操作二进制数据,就需要使用BytesIO.
使用ByteIO进行文件文件读写的时候,我们写进去的与读出来的都是二进制的字符串
BytesIO实现了在内存中读写bytes,我们创建一个BytesIO,然后写入一些bytes:
from io import BytesIO
f = BytesIO()
f.write("中文".encode('utf-8'))
print(f.getvalue())
# 输出结果:b'\xe4\xb8\xad\xe6\x96\x87'
注意:写入的不是str,而是经过UTF-8编码的bytes
和StringIO类似,可以用一个bytes初始化BytesIO,然后,像读文件一样读取:
from io import BytesIO
f = BytesIO(b'\xe4\xb8\xad\xe6\x96\x87')
print(f.read())
# 输出结果 b'\xe4\xb8\xad\xe6\x96\x87'
from io import BytesIO
byteio1 = BytesIO()
byteio1.write(b"hello111")
print(byteio1.getvalue()) # 输出结果为 b'hello111'
byteio2 = BytesIO()
byteio2.write("中国".encode("utf-8"))
print(byteio2.getvalue())
# 输出结果为 b'\xe4\xb8\xad\xe5\x9b\xbd' 将"中国"转为二进制编码格式
byteio3 = BytesIO(b'hello111\xe4\xb8\xad\xe5\x9b\xbd')
print(byteio3.read().decode("utf-8"))
# 输出结果为 hello111中国 ;将字符串 "中国" 的二进制编码格式 转回字符串 "中国"
StringIO和BytesIO是在内存中操作str和bytes的方法,使得读写文件具有一致的接口.