数据探索在机器学习中我们一般称为EDA(Exploratory Data Analysis)是指对已有的数据(特别是调查或观察得来的原始数据)在尽量少的先验假定下进行探索,通过作图、制表、方程拟合、计算特征量等手段探索数据的结构和规律的一种数据分析方法。
其实,换句话就是说如果拿到一堆数据,你需要通过数据的特征来判断你用什么算法,而不是本末倒置,比如二分类问题,数据集的分布会明显分为两类,有一条"直线"可以将其分割开,那么你从数据上得到的信息是你可以用逻辑回归的算法处理数据。那么拿到具体的算法后,你需要对数据中的归一化等操作,比如使用梯度下降的时候,可能会更快,还有如果有必要,需要进行异常值进行处理,避免对算法造成干扰
1.常见的特征工程
- 异常处理:
- 通过箱线图(或 3-Sigma)分析删除异常值;
- BOX-COX 转换(处理有偏分布);
- 长尾截断;
- 特征归一化/标准化:
- 标准化(转换为标准正态分布);
- 归一化(抓换到 [0,1] 区间);
- 针对幂律分布,可以采用公式: l o