python数据预处理 :数据共线性处理详解

最新推荐文章于 2023-02-24 12:19:17 发布

程序员学府

最新推荐文章于 2023-02-24 12:19:17 发布

阅读量1.7k

点赞数

分类专栏： python基础编程文章标签：人工智能编程语言 python

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/chengxun02/article/details/105082278

版权

今天小编就为大家分享一篇python数据预处理 :数据共线性处理详解，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧何为共线性：共线性问题指的是输入的自变量之间存在较高的线性相关度。共线性问题会导致回归模型的稳定性和准确性大大降低，另外，过多无关的维度计算也很浪费时间共线性产生原因：变量出现共线性的原因：数据样本不够，导致共线性存在偶然性，这其实反映了缺少数据对于数据建模...

摘要由CSDN通过智能技术生成

今天小编就为大家分享一篇python数据预处理 :数据共线性处理详解，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧
何为共线性：

共线性问题指的是输入的自变量之间存在较高的线性相关度。共线性问题会导致回归模型的稳定性和准确性大大降低，另外，过多无关的维度计算也很浪费时间

共线性产生原因：

变量出现共线性的原因：

数据样本不够，导致共线性存在偶然性，这其实反映了缺少数据对于数据建模的影响，共线性仅仅是影响的一部分

多个变量都给予时间有共同或相反的演变趋势，例如春节期间的网络销售量和销售额都相对与正常时间有下降趋势。

多个变量存在一定的推移关系，但总体上变量间的趋势一致，只是发生的时间点不一致，例如广告费用和销售额之间，通常是品牌广告先进行大范围的曝光和信息推送，经过一定时间传播之后，才会在销售额上做出反映。

多变量之间存在线性的关系。例如y代表访客数，用x代表展示广告费用，那么二者的关系很可能是y=2*x + b

如何检验共线性：

检验共线性：

容忍度（Tolerance）：容忍度是每个自变量作为因变量对其他自变量进行回归建模时得到的残差比例，大小用1减得到的决定系数来表示。容忍度值越小说明这个自变量与其他自变量间越可能存在共线性问题。

方差膨胀因子 VIF是容忍度的倒数，值越大则共线性问题越明显，通常以10作为判断边界。当VIF<10,不存在多重共线性；当10<=VIF<100,存在较强的多重共线性；当VIF>=100, 存在严重多重共线性。

特征值（Eigenvalue&#

最低0.47元/天解锁文章

程序员学府

关注

0
点赞
踩
4

收藏

觉得还不错? 一键收藏
0
评论
python数据预处理 :数据共线性处理详解

今天小编就为大家分享一篇python数据预处理 :数据共线性处理详解，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧何为共线性：共线性问题指的是输入的自变量之间存在较高的线性相关度。共线性问题会导致回归模型的稳定性和准确性大大降低，另外，过多无关的维度计算也很浪费时间共线性产生原因：变量出现共线性的原因：数据样本不够，导致共线性存在偶然性，这其实反映了缺少数据对于数据建模...
复制链接

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。