第7章数据清洗与准备_在数据分析和建模的过程中,相当多的时间要用在数据准备上:加载、清理、转换以及重-CSDN博客

在数据分析和建模的过程中，相当多的时间要用在数据准备上：加载、清理、转换以及重塑。这些工作会占到分析师时间的80%或更多。有时，存储在文件和数据库中的数据的格式不适合某个特定的任务。许多研究者都选择使用通用编程语言（如Python、Perl、R或Java）或UNIX文本处理工具（如sed或awk）对数据格式进行专门处理。幸运的是，pandas和内置的Python标准库提供了一组高级的、灵活的、快速的工具，可以让你轻松地将数据规整为想要的格式。
如果你发现了一种本书或pandas库中没有的数据操作方式，请在邮件列表或GitHub网站上提出。实际上，pandas的许多设计和实现都是由真实应用的需求所驱动的。
在本章中，我会讨论处理缺失数据、重复数据、字符串操作和其它分析数据转换的工具。下一章，我会关注于用多种方法合并、重塑数据集。

7.1 处理缺失数据

在许多数据分析工作中，缺失数据是经常发生的。pandas的目标之一就是尽量轻松地处理缺失数据。例如，pandas对象的所有描述性统计默认都不包括缺失数据。
缺失数据在pandas中呈现的方式有些不完美，但对于大多数用户可以保证功能正常。对于数值数据，pandas使用浮点值NaN（Not a Number）表示缺失数据。我们称其为哨兵值，可以方便的检测出来：
在pandas中，我们采用了R语言中的惯用法，即将缺失值表示为NA，它表示不可用not available。在统计应用中，NA数据可能是不存在的数据或者虽然存在，但是没有观察到（例如，数据采集中发生了问题）。当进行数据清洗以进行分析时，最好直接对缺失数据进行分析，以判断数据采集的问题或缺失数据可能导致的偏差。
Python内置的None值在对象数组中也可以作为NA：
pandas项目中还在不断优化内部细节以更好处理缺失数据，像用户API功能，例如pandas.isnull，去除了许多恼人的细节。表7-1列出了一些关于缺失数据处理的函数。

7.1.1 过滤缺失值

过滤掉缺失数据的办法有很多种。你可以通过pandas.isnull或布尔索引的手工方法，但dropna可能会更实用一些。对于一个Series，dropna返回一个仅含非空数据和索引值的Series：
上面的例子与下面的代码是等价的：
而对于DataFrame对象，事情就有点复杂了。你可能希望丢弃全NA或含有NA的行或列。dropna默认丢弃任何含有缺失值的行：
传入how='all’将只丢弃全为NA的那些行：
用这种方式丢弃列，只需传入axis=1即可：
另一个滤除DataFrame行的问题涉及时间序列数据。假设你只想留下一部分观测数据，可以用thresh参数实现此目的：

7.1.2 补全缺失值

你可能不想滤除缺失数据（有可能会丢弃跟它有关的其他数据），而是希望通过其他方式填补那些“空洞”。对于大多数情况而言，fillna方法是最主要的函数。通过一个常数调用fillna就会将缺失值替换为那个常数值：
若是通过一个字典调用fillna，就可以实现对不同的列填充不同的值：
fillna默认会返回新对象，但也可以对现有对象进行就地修改：
用于重建索引的相同的插值方法也可以用于fillna:
只要有些创新，你就可以利用fillna实现许多别的功能。比如说，你可以传入Series的平均值或中位数：

7.2 数据转换

本章到目前为止介绍的都是数据的重排。另一类重要操作则是过滤、清理以及其他的转换工作。

7.2.1 删除重复值

DataFrame中出现重复行有多种原因。下面就是一个例子：
DataFrame的duplicated方法返回一个布尔型Series，表示各行是否是重复行（前面出现过的行）：
还有一个与此相关的drop_duplicates方法，它会返回一个DataFrame，重复的数组会标为False：
这两个方法默认会判断全部列，你也可以指定部分列进行重复项判断。假设我们还有一列值，且只希望根据k1列过滤重复项：
duplicated和drop_duplicates默认保留的是第一个出现的值组合。传入keep='last’则保留最后一个：

7.2.2 使用函数或映射进行数据转换

对于许多数据集，你可能希望基于DataFrame中的数组、列或列中的数值进行一些转换。考虑下面这些收集到的关于肉类的数据：
假设你想要添加一列表示该肉类食物来源的动物类型。我们先编写一个不同肉类到动物的映射：
Series的map方法可以接受一个函数或含有映射关系的字典型对象，但是这里有一个小问题，即有些肉类的首字母大写了，而另一些则没有。因此，我们还需要使用Series的str.lower方法，将各个值转换为小写：
我们也可以传入一个能够完成全部这些工作的函数：
使用map是一种实现元素级转换以及其他数据清理工作的便捷方式。

7.2.3 替代值

利用fillna方法填充缺失数据可以看做值替换的一种特殊情况。前面已经看到，map可用于修改对象的数据子集，而replace则提供了一种实现该功能的更简单、更灵活的方式。我们来看看下面这个Series：
-999这个值可能是一个表示缺失数据的标记值。要将其替换为pandas能够理解的NA值，我们可以利用replace来产生一个新的Series（除非传入inplace=True）：
要让每个值有不同的替换值，可以传递一个替换列表：
参数也可以通过字典传递：
笔记：data.replace方法与data.str.replace不同，后者做的是字符串的元素级替换。我们会在后面学习Series的字符串方法。

7.2.4 重命名轴索引

跟Series中的值一样，轴标签也可以通过函数或映射进行转换，从而得到一个新的不同标签的对象。轴还可以被就地修改，而无需新建一个数据结构。接下来看看下面这个简单的例子：
跟Series一样，轴索引也有一个map方法：
你可以将其赋值给index，这样就可以对DataFrame进行就地修改：
如果想要创建数据集的转换版（而不是修改原始数据），比较实用的方法是rename：
特别说明一下，rename可以结合字典型对象实现对部分轴标签的更新：
rename可以实现复制DataFrame并对其索引和列标签进行赋值。如果希望就地修改某个数据集，传入inplace=True即可：

7.2.5 离散化和分箱

连续值经常需要离散化，或者分离成“箱子”进行分析。假设你有某项研究中一组人群的数据，你想把他们进行分组，放入离散的年龄框中：
接下来将这些数据划分为“18到25”、“26到35”、“35到60”以及“60以上”等若干组。要实现该功能，你需要使用pandas的cut函数：
pandas返回的是一个特殊的Categorical对象。你看到的输出描述了由pandas.cut计算出的箱。你可以将它当作一个表示箱名的字符串组；它在内部包含一个categories(类别）数组，它指定了不同的类别名称以及codes属性中的ages（年龄）数据标签：
请注意，pd.value_counts(cats)是对pandas.cut的结果中的箱数量的计数。与区间的数学符号一致，小括号表示边是开放的，中括号表示它是封闭的（包括边）。你可以通过传递right=False来改变哪一边是封闭的：
你也可以通过labels 选项传递一个列表或数组来传入自定义的箱：
如果你传给cut整数个的箱来代替显示的箱边，pandas将根据数据中的最小值和最大值计算出等长的箱。请考虑一些均匀分布的数据被切成四份的情况：
选项precision=2，限定小数只有两位。
qcut是一个非常类似于cut的函数，它可以根据样本分位数对数据进行分箱。根据数据的分布情况，cut可能无法使每个箱含有相同数量的数据点。而qcut由于使用的是样本分位数，因此可以得到等长的箱：
与cut类似，你可以传入自定义的分位数（0和1之间，包括端点）：
后续章节中，在讨论聚合和分组时，我们将会继续讨论cut和qcut，因为这些离散化函数对于分位数和分组特别有用。

7.2.6检测和过滤异常值

过滤或变换异常值（outlier）在很大程度上就是运用数组运算。来看一个含有正态分布数据的DataFrame：
假设你想要找出一列中绝对值大于三的值：
要选出全部含有“超过3或－3的值”的行，你可以对布尔值DataFrame中使用any方法：
根据这些条件，就可以对值进行设置。下面的代码可以将值限制在区间－3到3以内：
根据数据的值是正还是负，np.sign(data)可以生成1和-1：

7.2.7 置换和随机抽样

利用numpy.random.permutation函数可以轻松实现对Series或DataFrame的列的排列工作（permuting，随机重排序）。通过需要排列的轴的长度调用permutation，可产生一个表示新顺序的整数数组：
整数数组可以用在基于iloc的索引或等价的take函数中：
要选出一个不含有替代值的随机子集，你可以使用Series和DataFrame上的sample方法：
要通过替换的方式产生样本（允许重复选择），可以传递replace=True到sample：

7.2.8 计算指标/虚拟变量

另一种常用于统计建模或机器学习的转换方式是：将分类变量（categorical variable）转换为“哑变量”或“指标矩阵”。
如果DataFrame的某一列中含有k个不同的值，则可以派生出一个k列矩阵或DataFrame（其值全为1和0）。pandas有一个get_dummies函数可以实现该功能（其实自己动手做一个也不难）。使用之前的一个DataFrame例子：
有时候，你可能想给指标DataFrame的列加上一个前缀，以便能够跟其他数据进行合并。get_dummies的prefix参数可以实现该功能：
如果DataFrame中的某行同属于多个分类，则事情就会有点复杂。看一下MovieLens 1M数据集，14章会更深入地研究它：
要为每个genre添加指标变量就需要做一些数据规整操作。首先，我们从数据集中抽取出不同的genre值：
然后我们得到：
使用全0的DataFrame是构建指标DataFrame的一种方式：
现在，迭代每一部电影，并将dummies各行的条目设为1。要这么做，我们使用dummies.columns来计算每个类型的列索引：
然后，根据索引，使用.iloc设定值：
然后，和以前一样，再将其与movies合并起来：
笔记：对于很大的数据，用这种方式构建多成员指标变量就会变得非常慢。最好使用更低级的函数，将其写入NumPy数组，然后结果包装在DataFrame中。
一个对统计应用有用的秘诀是：结合get_dummies和诸如cut之类的离散化函数：
我们用numpy.random.seed，使这个例子具有确定性。本书后面会介绍pandas.get_dummies。

7.3 字符串操作

Python能够成为流行的数据处理语言，部分原因是其简单易用的字符串和文本处理功能。大部分文本运算都直接做成了字符串对象的内置方法。对于更为复杂的模式匹配和文本操作，则可能需要用到正则表达式。pandas对此进行了加强，它使你能够对整组数据应用字符串表达式和正则表达式，而且能处理烦人的缺失数据。

7.3.1 字符串对象方法

对于许多字符串处理和脚本应用，内置的字符串方法已经能够满足要求了。例如，以逗号分隔的字符串可以用split拆分成数段：
split常常与strip一起使用，以去除空白符（包括换行符）：
利用加法，可以将这些子字符串以双冒号分隔符的形式连接起来：
但这种方式并不是很实用。一种更快更符合Python风格的方式是，向字符串"::"的join方法传入一个列表或元组：
其他方法涉及定位子字符串。使用Python的in关键字是检测子字符串的最佳方法，尽管index和find也能实现同样的功能：
注意find和index的区别：如果找不到字符串，index将会引发一个异常（而不是返回－1）：
与此相关，count可以返回指定子串的出现次数：
replace用于将指定模式替换为另一个模式。通过传入空字符串，它也常常用于删除模式：
后续你将看到正则表达式也可以用于这些方法。

7.3.2 正则表达式

正则表达式提供了一种灵活的在文本中搜索或匹配（通常比前者复杂）字符串模式的方式。正则表达式，常称作regex，是根据正则表达式语言编写的字符串。Python内置的re模块负责对字符串应用正则表达式。我将通过一些例子说明其使用方法。
笔记：正则表达式的编写技巧可以自成一章，超出了本书的范围。从网上和其它书可以找到许多非常不错的教程和参考资料。
re模块的函数可以分为三个大类：模式匹配、替换以及拆分。当然，它们之间是相辅相成的。一个regex描述了需要在文本中定位的一个模式，它可以用于许多目的。我们先来看一个简单的例子：假设我想要拆分一个字符串，分隔符为数量不定的一组空白符（制表符、空格、换行符等）。描述一个或多个空白符的regex是\s+：
调用re.split(’\s+’,text)时，正则表达式会先被编译，然后再在text上调用其split方法。你可以用re.compile自己编译regex以得到一个可重用的regex对象：
如果只希望得到匹配regex的所有模式，则可以使用findall方法：
笔记：如果想避免正则表达式中不需要的转义（\），则可以使用原始字符串字面量如r’C:\x’（也可以编写其等价式’C:\x’）。
如果打算对许多字符串应用同一条正则表达式，强烈建议通过re.compile创建regex对象。这样将可以节省大量的CPU时间。
match和search跟findall功能类似。findall返回的是字符串中所有的匹配项，而search则只返回第一个匹配项。match更加严格，它只匹配字符串的首部。来看一个小例子，假设我们有一段文本以及一条能够识别大部分电子邮件地址的正则表达式：
对text使用findall将得到一组电子邮件地址：
search返回的是文本中第一个电子邮件地址（以特殊的匹配项对象形式返回）。对于上面那个regex，匹配项对象只能告诉我们模式在原字符串中的起始和结束位置：
regex.match则将返回None，因为它只匹配出现在字符串开头的模式：
相关的，sub方法可以将匹配到的模式替换为指定字符串，并返回所得到的新字符串：
假设你不仅想要找出电子邮件地址，还想将各个地址分成3个部分：用户名、域名以及域后缀。要实现此功能，只需将待分段的模式的各部分用圆括号包起来即可：
由这种修改过的正则表达式所产生的匹配项对象，可以通过其groups方法返回一个由模式各段组成的元组：
对于带有分组功能的模式，findall会返回一个元组列表：
sub还能通过诸如\1、\2之类的特殊符号访问各匹配项中的分组。符号\1对应第一个匹配的组，\2对应第二个匹配的组，以此类推：
Python中还有许多的正则表达式，但大部分都超出了本书的范围。表7-4是一个简要概括。

7.3.3 pandas 中的向量化字符串函数

清理待分析的散乱数据时，常常需要做一些字符串规整化工作。更为复杂的情况是，含有字符串的列有时还含有缺失数据：
通过data.map，所有字符串和正则表达式方法都能被应用于（传入lambda表达式或其他函数）各个值，但是如果存在NA（null）就会报错。为了解决这个问题，Series有一些能够跳过NA值的面向数组方法，进行字符串操作。通过Series的str属性即可访问这些方法。例如，我们可以通过str.contains检查各个电子邮件地址是否含有"gmail"：
也可以使用正则表达式，还可以加上任意re选项（如IGNORECASE）：
有两个办法可以实现矢量化的元素获取操作：要么使用str.get，要么在str属性上使用索引：
要访问嵌入列表中的元素，我们可以传递索引到这两个函数中：
你可以利用这种方法对字符串进行截取：
表7-5介绍了更多的pandas字符串方法。