备注:以下均参考Python数据分析和数据挖掘实战
在利用Scikit-Learn对数据进行逻辑回归之前。首先进行特征筛选。特征筛选的方法很多,主要包含在Scikit-Learn的feature-selection库中,比较简单的有通过F检验(f_regression)来给出各个特征的F值个P值,从而可以筛选变量(选在F值达回执P值小的特征)。一下为利用稳定性选择方法中的随机逻辑回归进行特征筛选,然后利用筛选后的特征建立逻辑回归模型,输出平均正确率
数据为商品的一些销售信息,通过商品的销售信息,判断商品的好坏
代码清单如下
-------------------------------------------------------------------------------------------------------------------------------------------------------------------------
import pandas as pd
from sklearn.linear_model import LogisticRegression as LR
from sklearn.linear_model import RandomizedLogisticRegression as RLR
data=pd.read_excel('categ_lvl3.xlsx')
select_var=~data.columns.isin(["CATEG_LVL3_ID","CATEG_LVL3_NAME","CATEG_LVL1_ID","FLAG","PROB","FLAG_PRE"])
pre_test=