python虚拟变量回归_虚拟变量提升多元线性回归模型精度(附Python代码与数据)...

本文介绍了如何使用Python中的虚拟变量(哑元变量)来提高多元线性回归模型的精度。通过实例展示了如何将名义变量转换为虚拟变量,并通过statsmodels库进行建模。文中强调在构建模型时需要排除一个虚拟变量以避免满秩矩阵,并讨论了模型结果中虚拟变量的含义。此外,还提到了模型中可能存在的多元共线性问题。
摘要由CSDN通过智能技术生成

关注一下~,更多商业数据分析案例等你来撩

前言

构建多元线性回归模型时,如果能够充分的使用已有变量,或将其改造成另一种形式的可供使用的变量,将在一定程度上提高模型精度及其泛化能力。因为数据集中的名义变量(或叫类别变量)是无法直接使用的,所以虚拟变量(又叫哑元变量)的设置便是非常经典且必须掌握的一步,原理简单,实现优雅,效果拔群。

原理趣析

至于虚拟变量的官方解释和值得参考的论文集和虚拟变量的深度应用及拓展,笔者都已经打包好了,私信我即可,我每天固定时间会查看。因为虚拟变量的原理其实非常简单,所以如何有趣且快速的理解原理并应用于实际的 Python 程序才是本文的侧重点。

将无法直接用于建模的名义变量转换成可放入模型的虚拟变量的核心就短短八个字:四散拆开,非此即彼。下面用一个只有4行的微型数据集辅以说明。

从上表中,不难发现:该名义变量有 n 类,就能拆分出 n 个名义变量

巧妙的使用 0 和 1 来达到用虚拟变量列代替原名义变量所在类别

接下来要做的就是将生成的虚拟变量们放入多元线性回归模型,但要注意的是:转化后的虚拟变量们需要舍弃一个,才能得到满秩矩阵。具体原因和有关线性代数的解释可以查看笔者打包好的论文,我们可以理解为,当该名义变量可划分为 n 类时,只需要 n-1 个虚拟变量就已足够获知所有信息了。该丢弃哪个,可根据实际情况来决定。

  • 0
    点赞
  • 4
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值