像Excel一样使用python进行数据分析

最新推荐文章于 2024-07-27 12:20:46 发布

weixin_34037977

最新推荐文章于 2024-07-27 12:20:46 发布

阅读量1.3k

点赞数 4

文章标签： python 数据库

Excel是数据分析中最常用的工具，本篇文章通过python与excel的功能对比介绍如何使用python通过函数式编程完成excel中的数据处理及分析工作。在Python中pandas库用于数据处理，我们从1787页的pandas官网文档中总结出最常用的36个函数，通过这些函数介绍如何通过python完成数据生成和导入，数据清洗，预处理，以及最常见的数据分类，数据筛选，分类汇总，透视等最常见的操作。

文章内容共分为9个部分。这是第一篇，介绍前3部分内容，数据表生成，数据表查看，和数据清洗。以下是《像Excel一样使用python进行数据分析》系列文章的目录。

1，生成数据表

第一部分是生成数据表，常见的生成方法有两种，第一种是导入外部数据，第二种是直接写入数据。 Excel中的文件菜单中提供了获取外部数据的功能，支持数据库和文本文件和页面的多种数据源导入。

python支持从多种类型的数据导入。在开始使用python进行数据导入前需要先导入pandas库，为了方便起见，我们也同时导入numpy库。

 
         import 
         numpy as np 
        
         import 
         pandas as pd

导入数据表

下面分别是从excel和csv格式文件导入数据并创建数据表的方法。代码是最简模式，里面有很多可选参数设置，例如列名称，索引列，数据格式等等。感兴趣的朋友可以参考pandas的
官方文档。

 
         df 
         = 
         pd.DataFrame(pd.read_csv( 
         'name.csv' 
         ,header 
         = 
         1 
         )) 
        
         df 
         = 
         pd.DataFrame(pd.read_excel( 
         'name.xlsx' 
         ))

创建数据表

另一种方法是通过直接写入数据来生成数据表，excel中直接在单元格中输入数据就可以，python中通过下面的代码来实现。生成数据表的函数是pandas库中的DateFrame函数，数据表一共有6行数据，每行有6个字段。在数据中我们特意设置了一些NA值和有问题的字段，例如包含空格等。后面将在数据清洗步骤进行处理。后面我们将统一以DataFrame的简称df来命名数据表。

 
   
    
      
       
         df  
         = 
         pd.DataFrame({
           
         "id" 
         :[ 
         1001 
         , 
         1002 
         , 
         1003 
         , 
         1004 
         , 
         1005 
         , 
         1006 
         ], 
        
 
                             
         "date" 
         :pd.date_range( 
         '20130102' 
         , periods 
         = 
         6 
         ), 
        
 
                             
         "city" 
         :[ 
         'Beijing ' 
         ,  
         'SH' 
         ,  
         ' guangzhou ' 
         ,  
         'Shenzhen' 
         ,  
         'shanghai' 
         ,  
         'BEIJING ' 
         ], 
        
 
                             
         "age" 
         :[ 
         23 
         , 
         44 
         , 
         54 
         , 
         32 
         , 
         34 
         , 
         32 
         ], 
        
 
                             
         "category" 
         :[ 
         '100-A' 
         , 
         '100-B' 
         , 
         '110-A' 
         , 
         '110-C' 
         , 
         '210-A' 
         , 
         '130-F' 
         ], 
        
 
                             
         "price" 
         :[ 
         1200 
         ,np.nan, 
         2133 
         , 
         5433 
         ,np.nan, 
         4432 
         ]}, 
        
 
                             
         columns  
         = 
         [ 
         'id' 
         , 
         'date' 
         , 
         'city' 
         , 
         'category' 
         , 
         'age' 
         , 
         'price' 
         ]) 
        

     

    
  

这是刚刚创建的数据表，我们没有设置索引列，price字段中包含有NA值，city字段中还包含了一些脏数据。

2，数据表检查

第二部分是对数据表进行检查，python中处理的数据量通常会比较大，比如我们之前的文章中介绍的纽约出租车数据和Citibike的骑行数据，数据量都在千万级，我们无法一目了然的了解数据表的整体情况，必须要通过一些方法来获得数据表的关键信息。数据表检查的另一个目的是了解数据的概况，例如整个数据表的大小，所占空间，数据格式，是否有空值和重复项和具体的数据内容。为后面的清洗和预处理做好准备。

数据维度(行列)

Excel中可以通过CTRL+向下的光标键，和CTRL+向右的光标键来查看行号和列号。Python中使用shape函数来查看数据表的维度，也就是行数和列数，函数返回的结果(6,6)表示数据表有6行，6列。下面是具体的代码。

数据表信息

使用info函数查看数据表的整体信息，这里返回的信息比较多，包括数据维度，列名称，数据格式和所占空间等信息。

 
   
    
      
       
         #数据表信息 
        
 
         df.info() 
        

            
        
 
         &lt; 
         class 
         'pandas.core.frame.DataFrame' 
         &gt; 
        
 
         RangeIndex:  
         6 
         entries,  
         0 
         to  
         5 
        
 
         Data columns (total  
         6 
         columns): 
        
 
         id          
         6 
         non 
         - 
         null int64 
        
 
         date         
         6 
         non 
         - 
         null datetime64[ns] 
        
 
         city         
         6 
         non 
         - 
         null  
         object 
        
 
         category     
         6 
         non 
         - 
         null  
         object 
        
 
         age          
         6 
         non 
         - 
         null int64 
        
 
         price        
         4 
         non 
         - 
         null float64 
        
 
         dtypes: datetime64[ns]( 
         1 
         ), float64( 
         1 
         ), int64( 
         2 
         ),  
         object 
         ( 
         2 
         ) 
        
 
         memory usage:  
         368.0 
         + 
         bytes 
        

     

    
  

查看数据格式

Excel中通过选中单元格并查看开始菜单中的数值类型来判断数据的格式。Python中使用dtypes函数来返回数据格式。

Dtypes是一个查看数据格式的函数，可以一次性查看数据表中所有数据的格式，也可以指定一列来单独查看。

 
         #查看数据表各列格式 
        
         df.dtypes 
        
         id                   
         int64 
        
         date        datetime64[ns] 
        
         city                 
         object 
        
         category             
         object 
        
         age                  int64 
        
         price              float64 
        
         dtype:  
         object

 
         #查看单列格式 
        
         df[ 
         'B' 
         ].dtype 
        
         dtype( 
         'int64' 
         )

查看空值

Excel中查看空值的方法是使用“定位条件”功能对数据表中的空值进行定位。“定位条件”在“开始”目录下的“查找和选择”目录中。

Isnull是Python中检验空值的函数，返回的结果是逻辑值，包含空值返回True，不包含则返回False。可以对整个数据表进行检查，也可以单独对某一列进行空值检查。

 
         #检查数据空值 
        
         df.isnull()

 
         #检查特定列空值 
        
         df[ 
         'price' 
         ].isnull() 
        
         0    
         False 
        
         1     
         True 
        
         2    
         False 
        
         3    
         False 
        
         4     
         True 
        
         5    
         False 
        
         Name: price, dtype:  
         bool

查看唯一值

Excel中查看唯一值的方法是使用“条件格式”对唯一值进行颜色标记。Python中使用unique函数查看唯一值。

Unique是查看唯一值的函数，只能对数据表中的特定列进行检查。下面是代码，返回的结果是该列中的唯一值。类似与Excel中删除重复项后的结果。

 
         #查看city列中的唯一值 
        
         df[ 
         'city' 
         ].unique() 
        
         array([ 
         'Beijing ' 
         ,  
         'SH' 
         ,  
         ' guangzhou ' 
         ,  
         'Shenzhen' 
         ,  
         'shanghai' 
         ,  
         'BEIJING ' 
         ], dtype 
         = 
         object 
         )

查看数据表数值

Python中的Values函数用来查看数据表中的数值。以数组的形式返回，不包含表头信息。

 
         #查看数据表的值 
        
         df.values 
        
         array([[ 
         1001 
         , Timestamp( 
         '2013-01-02 00:00:00' 
         ),  
         'Beijing ' 
         ,  
         '100-A' 
         ,  
         23 
         , 
        
         1200.0 
         ], 
        
         [ 
         1002 
         , Timestamp( 
         '2013-01-03 00:00:00' 
         ),  
         'SH' 
         ,  
         '100-B' 
         ,  
         44 
         , nan], 
        
         [ 
         1003 
         , Timestamp( 
         '2013-01-04 00:00:00' 
         ),  
         ' guangzhou ' 
         ,  
         '110-A' 
         ,  
         54 
         , 
        
         2133.0 
         ], 
        
         [ 
         1004 
         , Timestamp( 
         '2013-01-05 00:00

最低0.47元/天解锁文章

weixin_34037977

关注

4
点赞
踩
31

收藏

觉得还不错? 一键收藏
0
评论
像Excel一样使用python进行数据分析

Excel是数据分析中最常用的工具，本篇文章通过python与excel的功能对比介绍如何使用python通过函数式编程完成excel中的数据处理及分析工作。在Python中pandas库用于数据处理，我们从1787页的pandas官网文档中总结出最常用的36个函数，通过这些函数介绍如何通过python完成数据生成和导入，数据清洗，预处理，以及最常见的数据分类，数据筛选，分类汇总，透视等最常见...
复制链接

扫一扫