建模时对因变量的处理

最新推荐文章于 2022-11-27 17:16:58 发布

thisissally

最新推荐文章于 2022-11-27 17:16:58 发布

阅读量462

点赞数

分类专栏：建模文章标签： python

本文链接：https://blog.csdn.net/weixin_45366750/article/details/119646305

版权

建模专栏收录该内容

9 篇文章 0 订阅

订阅专栏

一、查看因变量的分布

（一）连续

sns.displot(y)  # defaul kde=True有和密度曲线

（二）离散

df.x.value_counts()

二、修正因变量的分布

（一）查看因变量的分布

大部分模型，尤其是线性模型，需要因变脸y服从正态分布。如果y不服从正态分布，可以尝试用

import scipy.stats as st
y = Train_data['price']

plt.figure(2); plt.title('Normal')
sns.distplot(y, kde=False, fit=st.norm)  # kde=False不显示核密度曲线，查看直方图与指定分布地贴合程度

plt.figure(1); plt.title('Johnson SU')
sns.distplot(y, kde=False, fit=st.johnsonsu)   # 无界约翰逊分布

plt.figure(3); plt.title('Log Normal')
sns.distplot(y, kde=False, fit=st.lognorm)

（二）log变换

问题：随着时间序列，y的方差变大
建模需要满足的假设：方差齐性假设，使y的变换更加平滑
方法：log变换

（三）正态变换

方法：box-cox变换

确定要放弃本次机会？

福利倒计时

: :

立减 ¥

普通VIP年卡可用

立即使用

thisissally

关注关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
建模时对因变量的处理

一、查看因变量的分布（一）连续sns.displot(y) # defaul kde=True有和密度曲线（二）离散df.x.value_counts()二、修正因变量的分布（一）查看因变量的分布大部分模型，尤其是线性模型，需要因变脸y服从正态分布。如果y不服从正态分布，可以尝试用import scipy.stats as sty = Train_data['price']plt.figure(2); plt.title('Normal')sns.distplot(y, kde
复制链接

扫一扫