python文件读写

最新推荐文章于 2024-09-17 23:15:58 发布

weixin_33895604

最新推荐文章于 2024-09-17 23:15:58 发布

阅读量58

点赞数

文章标签： python 内存管理

原文链接：https://my.oschina.net/u/3572879/blog/1610055

版权

2019独角兽企业重金招聘Python工程师标准>>>

文件读写的基本描述：

open/文件操作
f=open('/tmp/hello','w')

#open(路径+文件名,读写模式)

#读写模式:r只读,r+读写,w新建(会覆盖原有文件),a追加,b二进制文件.常用模式

如:'rb','wb','r+b'等等

读写模式的类型有：

rU 或 Ua 以读方式打开, 同时提供通用换行符支持 (PEP 278)
w     以写方式打开，
a     以追加模式打开 (从 EOF 开始, 必要时创建新文件)
r+     以读写模式打开
w+     以读写模式打开 (参见 w )
a+     以读写模式打开 (参见 a )
rb     以二进制读模式打开
wb     以二进制写模式打开 (参见 w )
ab     以二进制追加模式打开 (参见 a )
rb+    以二进制读写模式打开 (参见 r+ )
wb+    以二进制读写模式打开 (参见 w+ )
ab+    以二进制读写模式打开 (参见 a+ )

注意：

1、使用'W'，文件若存在，首先要清空，然后（重新）创建，

2、使用'a'模式，把所有要写入文件的数据都追加到文件的末尾，即使你使用了seek（）指向文件的其他地方，如果文件不存在，将自动被创建。

f.read([size]) size未指定则返回整个文件,如果文件大小>2倍内存则有问题.f.read()读到文件尾时返回""(空字串)

file.readline() 返回一行

file.readline([size]) 返回包含size行的列表,size 未指定则返回全部行

for line in f: print line #通过迭代器访问

f.write("hello\n") #如果要写入字符串以外的数据,先将他转换为字符串.

f.tell() 返回一个整数,表示当前文件指针的位置(就是到文件头的比特数).

f.seek(偏移量,[起始位置])

用来移动文件指针

偏移量:单位:比特,可正可负

起始位置:0-文件头,默认值;1-当前位置;2-文件尾

f.close() 关闭文件

读文件的方法：

read ()的方法是一次性把文件的内容以字符串的方式读到内存，放到一个字符串变量中

readlines()的方法是一次性读取所有内容，并按行生成一个list ,

因为read（）和readlines（）是一次性把文件加载到内存，如果文件较大，甚至比内存的大小还大，内存就会爆掉。所以，这两种方法只适合读取小的文件。

实际工作中，会碰到读取10几G的大文件的需求，比如说日志文件。这时候就要用的新的读取文件的方法。这里提供两种方法，有简单，有复杂，但基本原理都是一样的。就是利用到生成器generator。

python 读取大文件使用迭代器会减小内存的消耗

方法1：利用open（“”， “”）系统自带方法生成的迭代对象

使用with打开文件并将文件对于对象f当做迭代对象，for line in f 这种用法是把文件对象f当作迭代对象，系统将自动处理IO缓冲和内存管理，当读取大文件时不会一次性将文件读取到内存中，造成内存爆掉，迭代器会将需求的内容逐次读入内存

with open(file,'r') as f:
for line in f:
print(line)
逐行读取文件内容，避免一次将文件内容全部加载到内存中；

方法二：将文件切分成小段，每次处理完小段内容后，释放内存

这里会使用yield生成自定义可迭代对象，即generator，每一个带有yield的函数就是一个generator。