Python3分析考试成绩1成绩预处理

最新推荐文章于 2024-07-31 02:14:26 发布

limaning

最新推荐文章于 2024-07-31 02:14:26 发布

阅读量3.0k

点赞数 2

分类专栏： Python

本文链接：https://blog.csdn.net/limaning/article/details/86642696

版权

Python 专栏收录该内容

36 篇文章 0 订阅

订阅专栏

1.数据预处理

首先用Excel内部的VLOOKUP函数，将每位学生的成绩匹配。这里最好还是用身份证号或者学籍号进行匹配，一方面准确，不易出现重名、字符编码之类的问题，另一方面有利于保护学生数据隐私。

像一些学生因特殊原因没有成绩，一种处理方法是寻找类似变化的成绩进行替代，另一种是，如果缺失成绩过多，就将整行成绩去掉。可以考虑中间缺失值，用前后均值替代。值也可以考虑用之前的均值和之后均值的差，来填充这个差值，这个前后均值，可以考虑选取之前与缺失数据比较接近的程度的均值。使用相似样本的均值添补缺失值，或者考虑用机器学习的方法预测缺失值。但是如刚才所说，缺失成绩过多，则应删掉，也就是如果一共6项成绩，有4项缺失，则必须要删掉了。接下来，我们尝试用这样一种顺序来做相应数据的清洗：删除缺失过多的数据--对缺失数据进行填充--导出新的Excel。

1. 删除缺失过多的数据 2. 对缺失数据进行填充

import pandas as pd
tablePath = '1化学数据清洗.xls'

#导入测试的xls数据，并DataFrame化
originalData = pd.DataFrame(pd.read_excel(tablePath))   #导入excel数据，并转化为DataFrame格式
#print(originalData)
delDoneData = originalData.dropna(axis=0,thresh=5) #每行至少保留5个数据，也就是除了班级、姓名之外，还得有3个非空值数据，否则将删除整行
sortData = delDoneData.sort_values(by=['化学2'],ascending=False)                     #按第2列进行排序
sortData = sortData.reset_index(drop = True)        #重置索引
print(sortData)
sortData = sortData.interpolate(method='akima')   #用method= 改变参数，进行插值
print(sortData)
sortData.to_excel('1.xls')

Pandas 中的插值，通过 interpolate() 方法完成，默认为线性插值，即 method='linear'。除此之外，还有{‘linear’, ‘time’, ‘index’, ‘values’, ‘nearest’, ‘zero’, ‘slinear’, ‘quadratic’, ‘cubic’, ‘barycentric’, ‘krogh’, ‘polynomial’, ‘spline’, ‘piecewise_polynomial’, ‘from_derivatives’, ‘pchip’, ‘akima’}等插值方法可供选择。那么接下来，我们就对这些方法进行逐一比较。比较的数据，集中在几个典型的缺失数据上。