Python pandas 操作 excel 详解

1 概述

1.1 pandas 和 openpyxl 区别

  • Python 中的 pandas 和 openpyxl 库,均可以处理 excel 文件,其中主要区别:
    • pandas:① 数据操作和分析方面表现优异。它提供了各种文件格式(包括 Excel)中读取数据的函数,在过滤数据、汇总数据、处理缺失值和执行其它数据转换任务方便,特别有用。② 使用方便。DataFrame 对象,使用快速方便,且功能十分强大。
    • openpyxl侧重单元格格式设置。这个库也允许我们直接处理 Excel 文件。pandas 快,但 pandas 做不了的事情,可以让 openpyxl 来做,例如:单元格注释、填充背景色 等等

1.2 Series 和 DataFrame

  • Series:连续。可理解为 “一维数组”,由一行 或 一列 组成,具体是行,还是列,由 DataFrame 指定
  • DataFrame:数据框。可理解为 “二维数组”,由行和列组成
import pandas as pd

# Series 示例
s = pd.Series(['a', 'b', 'c'], index=[1, 2, 3], name='A')
print(s)
# 1    a
# 2    b
# 3    c
# Name: A, dtype: object

# DataFrame 示例
s1 = pd.Series(['a', 'b', 'c'], index=[1, 2, 3], name='A')
s2 = pd.Series(['aa', 'bb', 'cc'], index=[1, 2, 3], name='B')
s3 = pd.Series(['aaa', 'bbb', 'ccc'], index=[1, 2, 3], name='C')
# 方式1:指定 Series 为行
df = pd.DataFrame([s1, s2, s3])
print(df)
#      1    2    3
# A    a    b    c
# B   aa   bb   cc
# C  aaa  bbb  ccc

# 方式2:指定 Series 为列
df = pd.DataFrame({s1.name: s1, s2.name: s2, s3.name: s3})
print(df)
#    A   B    C
# 1  a  aa  aaa
# 2  b  bb  bbb
# 3  c  cc  ccc

2 常用操作

2.1 创建 Excel:to_excel()

import pandas as pd

# 测试数据
data = {'ID': [1, 2, 3], 'Name': ['张三', '李四', '王五']}

# 1.创建 DataFrame 对象
df = pd.DataFrame(data=data)

# 可选操作。将 ID 设为索引,若不设置,会使用默认索引 narray(n)
df = df.set_index('ID')  # 写法1
# df.set_index('ID', inplace=True)  # 写法2

# 2.写入 excel 至指定位置(若文件已存在,则覆盖)
df.to_excel(r'C:\Users\Administrator\Desktop\Temp\1.xlsx')

指定索引前后,效果对比:
在这里插入图片描述

2.2 读取 Excel:read_excel()

import pandas as pd

# 1.读取 excel。默认读取第一个 sheet
student = pd.read_excel(r'C:\Users\Administrator\Desktop\Temp\1.xlsx')

# 2.读取常用属性
print(student.shape)  # 形状(行,列)
print(student.columns)  # 列名

读取指定 sheet:
在这里插入图片描述

import pandas as pd

# 1.读取指定 sheet 的 excel,以下两种方式等同
student = pd.read_excel(r'C:\Users\Administrator\Desktop\Temp\1.xlsx', sheet_name=1)
# student = pd.read_excel(r'C:\Users\Administrator\Desktop\Temp\1.xlsx', sheet_name='Sheet2')

# 2.读取常用属性
print(student.shape)  # 形状(行,列)
print(student.columns)  # 列名

2.2.1 header:标题的行索引

场景1:默认。第一行为标题(行索引为 0,即:header=0)

在这里插入图片描述

import pandas as pd

# 文件路径
filePath = r'C:\Users\Administrator\Desktop\Temp\1.xlsx'

# 1.读取 excel(默认第 1 行为标题,行索引为 0,即:header=0)
student = pd.read_excel(filePath)
print(student.columns)
# Index(['ID', 'Name', 'Age', 'Grade'], dtype='object')

场景2:指定第 n 行为标题
在这里插入图片描述

import pandas as pd

# 文件路径
filePath = r'C:\Users\Administrator\Desktop\Temp\1.xlsx'

# 场景2:excel 中第 2 行才是我们想要的标题(即:header=1)
student = pd.read_excel(filePath, header=1)
print(student.columns)
# Index(['ID', 'Name', 'Age', 'Grade'], dtype='object')

场景3:没有标题,需要人为给定
在这里插入图片描述

import pandas as pd

# 文件路径
filePath = r'C:\Users\Administrator\Desktop\Temp\1.xlsx'

# 场景3:excel 中没有标题,需要人为设定
student = pd.read_excel(filePath, header=None)
student.columns = ['ID', 'Name', 'Age', 'Grade']
student.set_index('ID', inplace=True)  # 指定索引列,并替换原数据
student.to_excel(filePath)  # 写入至 Excel
print(student)
#    Name  Age  Grade
# ID                 
# 1    张三   18     90
# 2    李四   20     70
# 3    王五   21     80
# 4    赵六   19     90

2.2.2 index_col:索引列

import pandas as pd

# 文件路径
filePath = r'C:\Users\Administrator\Desktop\Temp\1.xlsx'

# 读取 Excel,不指定索引列(会默认新增一个索引列,从 0 开始)
student = pd.read_excel(filePath)
print(student)
#    ID Name  Age  Grade
# 0   1   张三   18     90
# 1   2   李四   20     70
# 2   3   王五   21     80
# 3   4   赵六   19     90


# 读取 Excel,指定索引列
student = pd.read_excel(filePath, index_col='ID')
print(student)
#    Name  Age  Grade
# ID                 
# 1    张三   18     90
# 2    李四   20     70
# 3    王五   21     80
# 4    赵六   19     90

索引相关:

import pandas as pd

# 文件路径
filePath = r'C:\Users\Administrator\Desktop\Temp\1.xlsx'

# 1.读取 excel,并指定索引列
student = pd.read_excel(filePath, index_col='ID')

2.2.3 dtype:数据类型

import pandas as pd

# 文件路径
filePath = r'C:\Users\Administrator\Desktop\Temp\1.xlsx'

# 1.读取 excel 并指定 数据类型
student = pd.read_excel(filePath, dtype={'ID': str, 'Name': str, 'Age': int, 'Grade': float})
print(student)
#   ID Name  Age  Grade
# 0  1   张三   18   90.0
# 1  2   李四   20   70.0
# 2  3   王五   21   80.0
# 3  4   赵六   19   90.0

2.2.4 skiprows:跳过的行数

  • 比如:Excel 中有空行,如下图
  • 实际的数据是在第 3 行,所以要跳过前 2 行

在这里插入图片描述

import pandas as pd

# 文件路径
filePath = r'C:\Users\Administrator\Desktop\Temp\1.xlsx'

student = pd.read_excel(filePath, skiprows=2)
print(student)
#    ID Name  Age  Grade
# 0   1   张三   18     90
# 1   2   李四   20     70
# 2   3   王五   21     80
# 3   4   赵六   19     90

2.2.5 usercols:指定列数

import pandas as pd

# 文件路径
filePath = r'C:\Users\Administrator\Desktop\Temp\1.xlsx'

# 读取 Excel B - D 列(均包含)
student = pd.read_excel(filePath, usecols='B:D')
print(student)
#   Name  Age  Grade
# 0   张三   18     90
# 1   李四   20     70
# 2   王五   21     80
# 3   赵六   19     90

在这里插入图片描述

2.2.6 head(n)、tail(n):读取前、后 n 行数据

  • 有时候,excel 数据量很大,读取全部会很耗时,也没必要
  • 咱测试时,仅读取部分行即可
import pandas as pd

# 1.读取 excel
student = pd.read_excel(r'C:\Users\Administrator\Desktop\Temp\1.xlsx')

# 读取前 3 行数据(默认 5 行)
print(student.head(3))

# 读取后 3 行数据(默认 5 行)
print(student.tail(3))

2.3 读写数据

2.3.1 at():获取单元格

import pandas as pd

# 文件路径
filePath = r'C:\Users\Administrator\Desktop\Temp\1.xlsx'

# 1.读取 excel 并指定 索引
student = pd.read_excel(filePath, index_col=None)

for i in person.index:
    # 读写单元格:ID列,i行 的数据
    student['ID'].at[i] = i + 2

print(student)

2.3.2 loc[]:数据筛选

import pandas as pd


def age_18_to_20(age):
    return 18 <= age <= 20


def grade_good(grade):
    return 90 <= grade <= 100


# 文件路径
filePath = r'C:\Users\Administrator\Desktop\Temp\1.xlsx'

# 1.读取 excel 并指定 索引
student = pd.read_excel(filePath, index_col='ID')
student = student.loc[student['Age'].apply(age_18_to_20)].loc[student['Grade'].apply(grade_good)]
print(student)

2.3.3 sort_values():数据排序

import pandas as pd

# 文件路径
filePath = r'C:\Users\Administrator\Desktop\Temp\1.xlsx'

# 1.读取 excel 并指定 索引
student = pd.read_excel(filePath, index_col='ID')

# 功能:排序
# by:待排序的字段
# ascending:顺序(True) 还是 逆序(False)
# inplace:是否替换当前对象
# 方式1:排序单个字段
student.sort_values(by='Grade', ascending=False, inplace=True)
print(student)
#    Name  Grade
# ID            
# 1    张三     90
# 4    赵六     90
# 3    王五     80
# 2    李四     70

# 方式2:排序多个字段,如:先顺序排列 Grade, 后逆序排列 ID
student.sort_values(by=['Grade', 'ID'], ascending=[True, False], inplace=True)
print(student)
#    Name  Grade
# ID            
# 2    李四     70
# 3    王五     80
# 4    赵六     90
# 1    张三     90

3 实战

3.1 遍历 Excel

import pandas as pd


def read_excel(excel_name):
    data = pd.read_excel(excel_name)
    for row in data.itertuples():
        # Index:索引, Name:字段名
        print(row.Index, row.Name)


if __name__ == '__main__':
    filePath = r'C:\Users\Administrator\Desktop\Temp\1.xlsx'
    read_excel(filePath)
### 回答1: Python Pandas是一种用于数据分析和操作的强大工具。它可以轻松地处理和操作数据,并具有多种格式的导入和导出功能。其中,写入Excel文件常常是数据分析工作必不可少的一个环节。 使用Python Pandas写入Excel文件的方式非常简单。首先需要导入Pandas库,然后将数据(DataFrame)转换为Excel文件并保存到指定路径。 具体操作步骤如下: 1. 导入Pandas库,通常的方式是使用“import pandas as pd”。 2. 准备数据,将数据存入DataFrame中。 3. 创建一个Excel文件,通过“writer = pd.ExcelWriter('文件路径及名称.xlsx')”指定文件路径和名称,其中“pd.ExcelWriter”是Pandas提供的一个类。 4. 将数据(DataFrame)写入Excel表格中,语法为“dataframe.to_excel(writer, sheet_name='Sheet1')”,其中dataframe为需要写入的数据,writer为创建的Excel文件对象,sheet_name为Excel表格的名称。 5. 最后调用“writer.save()”保存Excel文件。 总体而言,Python Pandas写入Excel文件是一个十分简单和高效的过程。无论是初学者还是数据分析专业人士,都可以通过这种方式将数据灵活地保存在Excel文件中。 ### 回答2: Pandas是一个强大的Python数据分析库,它提供了许多工具来处理和操作数据,其中之一就是写入Excel文档。在本文中,我们将学习如何使用Pandas将数据写入Excel。 1. 导入Pandas库 我们需要首先导入Pandas库,使用如下代码导入: ```python import pandas as pd ``` 2. 准备数据 下一步是准备我们要写入Excel的数据。我们可以使用Pandas的DataFrame对象来创建数据集,或者导入已有的数据集,例如csv,txt等。这里我们使用一个简单的例子,创建一个包含学生姓名和成绩的DataFrame对象: ```python data = {'姓名': ['张三', '李四', '王五', '赵六'], '成绩': [90, 88, 95, 92]} df = pd.DataFrame(data) ``` 3. 写入Excel 现在我们可以开始将数据写入Excel了。Pandas提供了一个名为`to_excel()`的方法,它可以将DataFrame写入Excel文件。我们需要指定Excel文件的名称和存储路径,其中文件名应以`.xlsx`结尾。还可以选择将行和列标签写入Excel文件,指定Sheet名称等。以下是一个完整的示例代码: ```python # 将数据写入excel文件 filepath = 'example.xlsx' # 文件保存路径和名称 sheetname = '成绩单' # Sheet名称 df.to_excel(filepath, sheet_name=sheetname, index=False) ``` 在上面的示例中,`index=False`表示不写入行标签,只写入数据。如果不设置这个参数,默认会写入行标签0,1,2等。 4. 写入多个Sheet 除了将一个Sheet写入ExcelPandas还可以将多个Sheet写入同一个Excel文件。我们只需要在`to_excel()`方法中指定要写入的Sheet名称即可。以下是一个示例代码: ```python # 写入多个sheet filepath = 'example.xlsx' with pd.ExcelWriter(filepath) as writer: df1.to_excel(writer, sheet_name='Sheet1', index=False) df2.to_excel(writer, sheet_name='Sheet2', index=False) ``` 在上面的示例中,我们使用了`pd.ExcelWriter()`方法创建了一个Excel文件对象,然后在`to_excel()`方法中指定了要写入的不同Sheet的名称。 总结 通过上面的例子,我们学习了如何使用Pandas库将数据写入Excel文档。使用Pandas,我们可以很容易地将数据从各种数据源(如csv,txt等)导入到DataFrame对象,然后将其写入Excel文件。Pandas还提供了许多其他方法,例如按条件过滤数据,对数据进行统计分析等。无论您是数据分析师、数据科学家还是开发人员,Pandas对于数据处理和分析都是非常有用的工具之一。 ### 回答3: Python中的pandas库是一种用于数据分析的工具。在数据分析中,我们通常需要将处理后的数据保存到excel表格中以便于后续的使用和分享。因此,pandas库提供了将数据写入excel表格的功能。 首先,我们需要使用pandas库中的`DataFrame`类来创建数据表格。接着,使用`to_excel()`方法将数据表格写入excel文件。下面是一个示例代码: ```python import pandas as pd # 创建数据表格 data = {'姓名': ['张三', '李四', '王五'], '年龄': [18, 20, 22], '性别': ['男', '男', '女']} df = pd.DataFrame(data) # 写入excel文件 df.to_excel('data.xlsx', sheet_name='Sheet1', index=False) ``` 以上代码首先创建了一个数据表格,并将其存储在变量`df`中。然后,使用`to_excel()`方法将`df`中的数据写入到名为`data.xlsx`的excel文件中的`Sheet1`工作表中。`index=False`参数表示不将行索引保存到excel文件中。 对于更加详细的pandas写入excel方法的使用,可以参考pandas官方文档或相关教程。
评论 3
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

鱼丸丶粗面

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值