Python爬虫——Python csv模块(读写文件)

通过爬虫将数据抓取的下来,然后把数据保存在文件,或者数据库中,这个过程称为数据的持久化存储。这里主要介绍 Python 内置模块 CSV 的读写操作。

CSV文件写入

1) csv.writer()

csv 模块中的 writer 类可用于读写序列化的数据,其语法格式如下:

writer(csvfile, dialect='excel', **fmtparams)

参数说明:

  • csvfile:必须是支持迭代(Iterator)的对象,可以是文件(file)对象或者列表(list)对象。
  • dialect:编码风格,默认为 excel 的风格,也就是使用逗号,分隔。
  • fmtparam:格式化参数,用来覆盖之前 dialect 对象指定的编码风格。

示例如下:

import csv
# 操作文件对象时,需要添加newline参数逐行写入,否则会出现空行现象
with open('eggs.csv', 'w', newline='') as csvfile:
    # delimiter 指定分隔符,默认为逗号,这里指定为空格
    # quotechar 表示引用符
    # writerow 单行写入,列表格式传入数据
    spamwriter = csv.writer(csvfile, delimiter=' ',quotechar='|')
    spamwriter.writerow(['www.CSDN.net'] * 5 + ['how are you'])
    spamwriter.writerow(['hello world', 'web site', 'www.CSDN.net'])

eggs.csv 文件内容如下:

www.CSDN.net www.CSDN.net www.CSDN.net www.CSDN.net www.CSDN.net |how are you|
|hello world| |web site| www.CSDN.net

其中,quotechar 是引用符,当一段话中出现分隔符的时候,用引用符将这句话括起来,以能排除歧义。

如果想同时写入多行数据,需要使用 writerrows() 方法,代码如下所示:

import csv
with open('aggs.csv', 'w', newline='') as f:
    writer = csv.writer(f)
    # 注意传入数据的格式为列表元组格式
    writer.writerows([('hello','world'), ('I','love','you')])

aggs.csv文件内容:

hello,world
I,love,you

2) csv.DictWriter()

当然也可使用 DictWriter 类以字典的形式读写数据,使用示例如下:

import csv
with open('names.csv', 'w', newline='') as csvfile:
    #构建字段名称,也就是key
    fieldnames = ['first_name', 'last_name']
    writer = csv.DictWriter(csvfile, fieldnames=fieldnames)
    # 写入字段名,当做表头
    writer.writeheader()
    # 多行写入
    writer.writerows([{'first_name': 'Baked', 'last_name': 'Beans'},{'first_name': 'Lovely', 'last_name': 'Spam'}])
    # 单行写入
    writer.writerow({'first_name': 'Wonderful', 'last_name': 'Spam'})

name.csv 文件内容,如下所示:

first_name,last_name
Baked,Beans
Lovely,Spam
Wonderful,Spam

CSV文件读取

1) csv,reader()

csv 模块中的 reader 类和  DictReader 类用于读取文件中的数据,其中 reader() 语法格式如下:

csv.reader(csvfile, dialect='excel', **fmtparams)

应用示例如下:

import csv
with open('eggs.csv', 'r', newline='') as csvfile:
    spamreader = csv.reader(csvfile, delimiter=' ', quotechar='|')
    for row in spamreader:
        print(', '.join(row))

输出结果:

www.CSDN.net, www.CSDN.net, www.CSDN.net, www.CSDN.net, www.CSDN.net, how are you
hello world, web site, www.CSDN.net

2) csv.DictReader()

应用示例如下:

import csv
with open('names.csv', newline='') as csvfile:
    reader = csv.DictReader(csvfile)
    for row in reader:
        print(row['first_name'], row['last_name'])

输出结果:

Baked Beans
Lovely Spam
Wonderful Spam

python教程,8天python从入门到精通,学python看这套就够了

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值