利用Python进行数据分析(四):数据加载、存储与文件格式

标题利用Python进行数据分析(四):数据加载、存储与文件格式

学习笔记来源于:简书https://www.jianshu.com/p/047d8c1c7e14

输入输出通常可以划分为几个大类:读取文本文件和其他更高效的磁盘存储格式,加载数据库中的数据,利用Web API操作网络资源。

一、读写文本格式的数据

1、pandas提供了一些用于将表格型数据读取为DataFrame对象的函数。下表对它们进行了总结,其中read_csv和read_table可能会是今后用得最多的。
在这里插入图片描述
这些函数的选项可以划分为以下几个大类:

索引:将一个或多个列当做返回的DataFrame处理,以及是否从文件、用户获取列名。
类型推断和数据转换:包括用户定义值的转换、和自定义的缺失值标记列表等。
日期解析:包括组合功能,比如将分散在多个列中的日期时间信息组合成结果中的单个列。
迭代:支持对大文件进行逐块迭代。
不规整数据问题:跳过一些行、页脚、注释或其他一些不重要的东西(比如由成千上万个逗号隔开的数值数据)。

首先我们来看一个以逗号分隔的(CSV)文本文件:

import matplotlib as mpl
import pandas as pd
import numpy as np
data=pd.read_csv("example.csv")
print(data)

输出结果为:
在这里插入图片描述

我们还可以使用read_table,并指定分隔符:

data1=pd.read_table("example.csv",sep=",")
print(data1)

并不是所以文件都有标题行。

data=pd.read_csv("example1.csv",header=None)

在这里插入图片描述
读入该文件的办法有两个。你可以让pandas为其分配默认的列名,也可以自己定义列名:

data1=pd.read_csv("example1.csv",names=["a","b","c","d","message"])

在这里插入图片描述
假设你希望将message列做成DataFrame的索引。你可以明确表示要将该列放到索引4的位置上,也可以通过index_col参数指定"message":

name=["a","b","c","d","message"]
data1=pd.read_csv("example1.csv",names=name,index_col="message")

在这里插入图片描述
如果希望将多个列做成一个层次化索引,只需传入由列编号或列名组成的列表即可:
在这里插入图片描述

data=pd.read
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值