python统计数据指标的常见方法

在对数据进行挖掘之前,我们得到的数据往往是不太理想的,数据缺失值太严重导致统计数据指标不太容易,这篇文章记录下如何在含有缺失值的情况下统计出我想要的一些数据

实验环境

  • ubuntu 18.04
  • python 3.6
  • numpy scipy pandas
  • 随意一个csv文件(当然是要有数据的,我的csv部分数据如下)
  • 每个py文件都导入了以下三个依赖
import numpy as np
import pandas as pd
from scipy import stats

读取csv文件

读取csv文件,并在函数中打印出读取的结果,最后返回一个DataFrame对象

def readcsv(filepath):
    """
    读取csv文件
    :param filpath: 文件路径
    """
    df = pd.read_csv(filepath)

    print(df)
    return df

filepath = 'santander-customer-satisfaction/test.csv'
readcsv(filepath)

我的运行结果结果如下:

删除数据中我们不需要的列(假设我不需要ID的属性)

def dropProperty(df, drop_properties):
    """
    传入一个数据表
    :param df: dataFrame对象
    :param drop_properties: 想要删除的属性集
    :return 返回一个删掉了一个或多个属性的df对象,不影响传入的对象
    """
  #axis=0代表删除相应的行,axis=1代表删除相应的列
    df = df.drop(drop_properties, axis=1)
    r
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值