【Python数据分析基础】: 数据缺失值处理

本文探讨了数据缺失的原因,包括无意、有意和不存在三种情况,并详细分析了数据缺失的类型:完全随机缺失、随机缺失和非随机缺失。接着,重点介绍了数据缺失的处理方法,包括删除记录、数据填补(如均值插补、K-means聚类填补、回归预测、多重插补等)以及不处理的选择。最后,强调了选择处理方法时需要考虑的因素,如数据量、缺失值随机性和模型兼容性。
摘要由CSDN通过智能技术生成

作者:xiaoyu

微信公众号:Python数据科学

知乎:python数据分析师


圣人曾说过:数据和特征决定了机器学习的上限,而模型和算法只是逼近这个上限而已。

再好的模型,如果没有好的数据和特征质量,那训练出来的效果也不会有所提高。数据质量对于数据分析而言是至关重要的,有时候它的意义会在某种程度上会胜过模型算法。

本篇开始分享如何使用Python进行数据分析,主要侧重介绍一些分析的方法和技巧,而对于pandas和numpy等Pyhon计算包的使用会在问题中提及,但不详细介绍。本篇我们来说说面对数据的缺失值,我们该如何处理。文末有博主总结的思维导图。

1 数据缺失的原因

首先我们应该知道:数据为什么缺失?数据的缺失是我们无法避免的,可能的原因有很多种,博主总结有以下三大类:

  • 无意的:信息被遗漏,比如由于工作人员的疏忽,忘记而缺失;或者由于数据采集器等故障等原因造成的缺失,比如系统实时性要求较高的时候,机器来不及判断和决策而造成缺失;
  • 有意的:有些数据集在特征描述中会规定将缺失值也作为一种特征值,这时候缺失值就可以看作是一种特殊的特征值;
  • 不存在:有些特征属性根本就是不存在的,比如一个未婚者的配偶名字就没法填写,再如一个孩子的收入状况也无法填写;

总而言之,对于造成缺失值的原因,我们需要明确:是因为疏忽或遗漏无意而造成的,还是说故意造成的,或者说根本不存在。只有知道了它的来源,我们才能对症下药,做相应的处理。

2 数据缺失的类型

在对缺失数据进行处理前,了解数据缺失的机制和形式是十分必要的。将数据集中不含缺失值的变量称为完全变量,数据集中含有缺失值的变量称为不完全变量。而从缺失的分布来将缺失可以分为完全随机缺失,随机缺失和完全非随机缺失。

  • 完全随机缺失(missing completely at random,MCAR):指的是数据的缺失是完全随机的,不依赖于任何不完全变量或完全变量,不影响样本的无偏性,如家庭地址缺失;
  • 随机缺失(missing at random,MAR):指的是数据的缺失不是完全随机的,即该类数据的缺失依赖于其他完全变量,如财务数据缺失情况与企业的大小有关;
  • 非随机缺失(missing not at random,MNAR):指的是数据的缺失与不完全变量自身的取值有关,如高收入人群不原意提供家庭收入;

对于随机缺失和非随机缺失,直接删除记录是不合适的,原因上面已经给出。随机缺失可以通过已知变量对缺失值进行估计,而非随机缺失的非随机性还没有很好的解决办法。

3 数据缺失的处理方法

重点来了,对于各种类型数据的缺失,我们到底要如何处理呢?以下是处理缺失值的四种方法:删除记录,数据填补,和不处理

1. 删除记录

优点:

  • 最简单粗暴;

缺点:

  • 牺牲了大量的数据,通过减少历史数据换取完整的信息,这样可能丢失了很多隐藏的重要信息;
  • 当缺失数据比例较大时,特别是缺失数据非随机分布时,直接删除可能会导致数据发生偏离,比如原本的正态分布变为非正太;
### 回答1: 块匹配法是一种常用的运动估计方法,可用于视频编码和视频传输领域。下面是一个简单的块匹配法的Python实现,用于运动补偿预测。 首先,将两个帧分别读入并转换为灰度图像。然后,设置块大小、搜索范围等参数。 ```python import cv2 import numpy as np # 读入两个帧并转换为灰度图像 frame1 = cv2.imread('frame1.jpg', 0) frame2 = cv2.imread('frame2.jpg', 0) # 设置块大小、搜索范围等参数 block_size = 16 search_range = 16 height, width = frame1.shape mvx = np.zeros((height//block_size, width//block_size)) mvy = np.zeros((height//block_size, width//block_size)) ``` 接下来,对每个块进行匹配。对于每个块,计算其在搜索范围内的所有可能位置与参考帧对应块的SAD(Sum of Absolute Differences),找到SAD最小的位置作为该块的运动矢量。 ```python # 对每个块进行匹配 for i in range(0, height//block_size): for j in range(0, width//block_size): min_sad = 1e9 for k in range(-search_range, search_range+1): for l in range(-search_range, search_range+1): if i*block_size+k < 0 or i*block_size+k+block_size > height or j*block_size+l < 0 or j*block_size+l+block_size > width: continue sad = np.sum(np.abs(frame1[i*block_size:i*block_size+block_size, j*block_size:j*block_size+block_size] - frame2[i*block_size+k:i*block_size+k+block_size, j*block_size+l:j*block_size+l+block_size])) if sad < min_sad: min_sad = sad mvx[i,j] = l mvy[i,j] = k ``` 最后,将运动矢量应用于参考帧的所有块,得到预测帧。 ```python # 将运动矢量应用于参考帧的所有块,得到预测帧 predict_frame = np.zeros((height, width), np.uint8) for i in range(0, height//block_size): for j in range(0, width//block_size): predict_frame[i*block_size:i*block_size+block_size, j*block_size:j*block_size+block_size] = frame2[i*block_size+mvy[i,j]:i*block_size+mvy[i,j]+block_size, j*block_size+mvx[i,j]:j*block_size+mvx[i,j]+block_size] # 显示结果 cv2.imshow('Reference Frame', frame1) cv2.imshow('Target Frame', frame2) cv2.imshow('Predicted Frame', predict_frame) cv2.waitKey(0) cv2.destroyAllWindows() ``` 注意,这只是一个简单的块匹配法的实现,实际使用时可能需要进行优化和改进。 ### 回答2: 块匹配法是一种用于运动补偿预测的常用方法,它在视频编码被广泛应用。下面是一个使用Python编写的块匹配法运动补偿预测的示例。 首先,我们导入必要的库: ```python import cv2 import numpy as np ``` 然后,我们加载视频帧并提取两个连续帧: ```python # 加载视频 cap = cv2.VideoCapture('video.mp4') # 读取第一帧 ret, frame1 = cap.read() # 读取第二帧 ret, frame2 = cap.read() ``` 接下来,我们将两个帧转换为灰度图像: ```python # 将帧转为灰度图像 gray1 = cv2.cvtColor(frame1, cv2.COLOR_BGR2GRAY) gray2 = cv2.cvtColor(frame2, cv2.COLOR_BGR2GRAY) ``` 然后,我们定义一个函数来执行块匹配算法: ```python def block_matching(prev, curr, block_size, search_range): height, width = prev.shape flow = np.zeros((height, width, 2), dtype=np.float32) # 对于每个块 for y in range(0, height - block_size, block_size): for x in range(0, width - block_size, block_size): prev_block = prev[y:y+block_size, x:x+block_size] min_diff = float('inf') best_dx, best_dy = 0, 0 # 在搜索范围内找到最佳匹配 for dy in range(-search_range, search_range+1): for dx in range(-search_range, search_range+1): curr_block = curr[y+dy:y+dy+block_size, x+dx:x+dx+block_size] # 计算块之间的差异 diff = np.sum(np.abs(prev_block - curr_block)) # 更新最小差异 if diff < min_diff: min_diff = diff best_dx, best_dy = dx, dy # 更新光流向量 flow[y:y+block_size, x:x+block_size, 0] = best_dx flow[y:y+block_size, x:x+block_size, 1] = best_dy return flow ``` 最后,我们调用这个函数并显示运动补偿预测的结果: ```python # 运动补偿预测 block_size = 16 search_range = 16 flow = block_matching(gray1, gray2, block_size, search_range) # 显示结果 cv2.imshow('Flow', flow) cv2.waitKey(0) # 释放资源 cap.release() cv2.destroyAllWindows() ``` 这就是使用块匹配法进行运动补偿预测的Python示例。通过计算块之间的差异并选择最佳匹配,我们可以得到运动的光流向量,从而实现视频的运动补偿预测。 ### 回答3: 运动补偿预测是指利用已知的运动信息对视频序列的运动进行预测和补偿,以减少图像的运动模糊和失真。块匹配法是常用的运动补偿预测方法之一,下面我将用Python来介绍一下。 块匹配法的基本思想是将当前帧图像的每个小块与参考帧图像的相邻位置进行比较,找出最相似的位置作为运动矢量,进而进行运动补偿。 首先,我们需要将视频序列读入并分割成图像帧。可以使用OpenCV库的函数cv2.VideoCapture来读入视频,并通过cv2.CAP_PROP_FRAME_COUNT属性获取视频的总帧数。然后,使用cv2.CaptureVideoWriter函数来创建一个用于保存处理结果的视频。 接下来,我们需要定义一个函数来实现块匹配方法。该函数接收两个图像帧作为输入,以及块的大小和步长。 在函数内部,我们可以通过两层for循环遍历当前帧的所有块,并调用cv2.matchTemplate函数来计算当前块与参考帧的相似度,得到匹配结果。 最后,我们需要找到匹配结果最小的值,并通过np.unravel_index函数找到最小值对应的位置。这个位置就是运动矢量。 根据得到的运动矢量,我们可以使用cv2.warpAffine函数来实现运动补偿,将运动矢量对应的参考帧位置的像素值拷贝到当前帧的相应位置。 最后,我们将处理结果写入保存视频的文件。 这就是使用块匹配法进行运动补偿预测的简单示例,希望对你有所帮助!
评论 2
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值