金融风控违约预测-task2

最新推荐文章于 2022-11-28 22:06:21 发布

尘归尘-北尘

最新推荐文章于 2022-11-28 22:06:21 发布

阅读量1k

点赞数

分类专栏：小白学习笔记文章标签：机器学习

本文链接：https://blog.csdn.net/hu_hao/article/details/108674737

版权

小白学习笔记专栏收录该内容

40 篇文章 1 订阅

订阅专栏

探索性数据分析

0.概述
1.数据总览
2.特征分析

0.概述

机器学习模型，是要学得数据中的分布规律，然后利用数据分布规律进行预测。我们的数据以特征为基本的表现形式，这些特征有的是有用的，有的是没有用的，建模之前进行的探索性数据分析，就是为了找出跟预测事物相关的特征，而进行的对数据的必要初步了解。
因此第一步，就是要看有哪些特征，分布如何，然后做合适的假设。尽管现在特征工程都在走形式化，流程化，但能对特征与目标之间关系的理性的规律性认识，仍然是机器学习建模中宝贵的经验。特别是金融中，要求可解释性强的模型，传统机器学习模型仍然占主导地位，对特征背后的意义与预测目标之间的关系要求更高。

1.数据总览

利用pandas，可以很方便的看到数据概况。

data_test_a.shape
# (200000, 48)
data_train.shape
# (800000, 47)
data_train.columns
# Index(['id', 'loanAmnt', 'term', 'interestRate', 'installment', 'grade',
#       'subGrade', 'employmentTitle', 'employmentLength', 'homeOwnership',
#       'annualIncome', 'verificationStatus', 'issueDate', 'isDefault',
#      'purpose', 'postCode', 'regionCode', 'dti', 'delinquency_2years',
#     'ficoRangeLow', 'ficoRangeHigh', 'openAcc', 'pubRec',
#    'pubRecBankruptcies', 'revolBal', 'revolUtil', 'totalAcc',
#      'initialListStatus', 'applicationType', 'earliesCreditLine', 'title',
#     'policyCode', 'n0', 'n1', 'n2', 'n2.1', 'n4', 'n5', 'n6', 'n7', 'n8',
#       'n9', 'n10', 'n11', 'n12', 'n13', 'n14'],
#      dtype='object')