数据挖掘之回归分析

回归分析概念

回归分析(regression analysis)是确定两种或两种以上变数间相互依赖的定量关系的一种统计分析方法。运用十分广泛,回归分析按照涉及的自变量的多少,可分为一元回归分析多元回归分析;按照 自变量因变量 之间的关系类型,可分为线性回归分析非线性回归分析如果在回归分析中,只包括一个自变量和一个因变量,且二者的关系可用一条直线近似表示,这种回归分析称为一元线性回归分析。如果回归分析中包括两个或两个以上的自变量,且因变量和自变量之间是线性关系,则称为多元线性回归分析。 通过这种方法可以确定,许多领域中各个因素(数据)之间的关系,从而可以通过其用来预测,分析数据。 
   方差齐性线性关系、 效应累加、 变量无测量误差、 变量服从 多元正态分布观察独立、 模型完整(没有包含不该进入的变量、也没有漏掉应该进入的变量)、 误差项独立且服从(0,1) 正态分布 。 
  现实数据常常不能完全符合上述假定。因此,统计学家研究出许多的回归模型来解决线性回归模型假定过程的约束。 
  研究一个或多个 随机变量 Y1 ,Y2 ,…,Yi与另一些变量X1、X2,…,Xk之间的关系的统计方法。又称多重回归分析。通常称Y1,Y2,…,Yi为因变量,X1、X2,…,Xk为自变量。回归分析是一类数学模型,特别当因变量和自变量为线性关系时,它是一种特殊的线性模型。最简单的情形是一个自变量和一个因变量,且它们大体上有线性关系,这叫一元线性回归,即模型为Y=a+bX+ε,这里X是自变量,Y是因变量,ε是随机误差,通常假定随机误差的均值为0,方差为σ^2(σ^2大于0)σ2与X的值无关。若进一步假定 随机误差 遵从正态分布,就叫做正态线性模型。一般的情形,差有k个自变量和一个因变量,因变量的值可以分解为两部分:一部分是由自变量的影响,即表示为自变量的函数,其中函数形式已知,但含一些未知参数;另一部分是由于其他未被考虑的因素和随机性的影响,即随机误差。当函数形式为未知参数的线性函数时,称线性回归分析模型;当函数形式为未知参数的非线性函数时,称为非线性回归分析模型。当自变量的个数大于1时称为多元回归,当因变量个数大于1时称为多重回归。 
  回归分析的主要内容为:①从一组数据出发确定某些变量之间的定量关系式,即建立数学模型并估计其中的未知参数。估计参数的常用方法是 最小二乘法 。②对这些关系式的可信程度进行检验。③在许多自变量共同影响着一个因变量的关系中,判断哪个(或哪些)自变量的影响是显著的,哪些自变量的影响是不显著的,将影响显著的自变量选入模型中,而剔除影响不显著的变量,通常用 逐步回归 向前回归 向后回归 等方法。④利用所求的关系式对某一生产过程进行预测或控制。回归分析的应用是非常广泛的,统计软件包使各种回归方法计算十分方便。


回归分析应用

相关分析研究的是现象之间是否相关、相关的方向和密切程度,一般不区别自变量或因变量。而回归分析则要分析现象之间相关的具体形式,确定其因果关系,并用数学模型来表现其具体关系。比如说,从相关分析中我们可以得知“质量”和“用户满意度”变量密切相关,但是这两个变量之间到底是哪个变量受哪个变量的影响,影响程度如何,则需要通过回归分析方法来确定。 
  一般来说,回归分析是通过规定因变量和自变量来确定变量之间的因果关系,建立回归模型,并根据实测数据来求解模型的各个参数,然后评价回归模型是否能够很好的拟合实测数据;如果能够很好的拟合,则可以根据自变量作进一步预测。 
  例如,如果要研究质量和用户满意度之间的因果关系,从实践意义上讲,产品质量会影响用户的满意情况,因此设用户满意度为因变量,记为Y;质量为自变量,记为X。根据图8-3的散点图,可以建立下面的线性关系: 
  Y=A+BX+§ 
  式中:A和B为待定参数,A为回归直线的截距;B为回归直线的斜率,表示X变化一个单位时,Y的平均变化情况;§为依赖于用户满意度的随机误差项。 
  在SPSS软件里可以很容易地实现线性回归,回归方程如下: 
  y=0.857+0.836x 
  回归直线在y轴上的截距为0.857、斜率0.836,即质量每提高一分,用户满意度平均上升0.836分;或者说质量每提高1分对用户满意度的贡献是0.836分。 

  上面所示的例子是简单的一个自变量的线性回归问题,在数据分析的时候,也可以将此推广到多个自变量的多元回归,具体的回归过程和意义请参考相关的统计学书籍。此外,在SPSS的结果输出里,还可以汇报R2,F检验值和T检验值。R2又称为方程的确定性系数(coefficient of determination),表示方程中变量X对Y的解释程度。R2取值在0到1之间,越接近1,表明方程中X对Y的解释能力越强。通常将R2乘以100%来表示回归方程解释Y变化的百分比。F检验是通过方差分析表输出的,通过显著性水平(significant level)检验回归方程的线性关系是否显著。一般来说,显著性水平在0.05以下,均有意义。当F检验通过时,意味着方程中至少有一个回归系数是显著的,但是并不一定所有的回归系数都是显著的,这样就需要通过T检验来验证回归系数的显著性。同样地,T检验可以通过显著性水平或查表来确定。在上面所示的例子中,各参数的意义如表8-2所示。 
  

表8-2 线性回归方程检验

指标     显著性水平                意义 
       0.89                     “质量”解释了89%的“用户满意度”的变化程度 
       276.82 0.001               回归方程的线性关系显著 
      16.64 0.001                 回归方程的系数显著 

  示例 SIM手机用户满意度与相关变量线性回归分析 
  我们以SIM手机的用户满意度与相关变量的线性回归分析为例,来进一步说明线性回归的应用。从实践意义讲上,手机的用户满意度应该与产品的质量、价格和形象有关,因此我们以“用户满意度”为因变量,“质量”、“形象”和“价格”为自变量,作线性回归分析。利用SPSS软件的回归分析,得到回归方程如下: 
  

用户满意度=0.008×形象+0.645×质量+0.221×价格 
  

对于SIM手机来说,质量对其用户满意度的贡献比较大,质量每提高1分,用户满意度将提高0.645分;其次是价格,用户对价格的评价每提高1分,其满意度将提高0.221分;而形象对产品用户满意度的贡献相对较小,形象每提高1分,用户满意度仅提高0.008分。 
  

方程各检验指标及含义如下: 
  

        指标              显著性水平                      意义 
         R                2 0.89                      “质量”和“形象”解释了89%的“用户满意度”的变化程度 
         F                248.53 0.001                  回归方程的线性关系显著 
         T(形象)        0.00 1.000                  “形象”变量对回归方程几乎没有贡献 
         T(质量)        13.93 0.001                 “质量”对回归方程有很大贡献 
         T(价格)        5.00 0.001                   “价格”对回归方程有很大贡献 

  从方程的检验指标来看,“形象”对整个回归方程的贡献不大,应予以删除。所以重新做“用户满意度”与“质量”、“价格”的回归方程如下: 
  

   用户满意度=0.645×质量+0.221×价格 
 

 对于SIM手机来说,质量对其用户满意度的贡献比较大,质量每提高1分,用户满意度将提高0.645分;用户对价格的评价每提高1分,其满意度将提高0.221分(在本示例中,因为“形象”对方程几乎没有贡献,所以得到的方程与前面的回归方程系数差不多)。 
 

 方程各检验指标及含义如下:


   指标                显著性水平                   意义 
     R                   0.89                     “质量”和“形象”解释了89%的“用户满意度”的变化程度 
     F                   374.69 0.001              回归方程的线性关系显著 
     T (质量)          15.15 0.001               “质量”对回归方程有很大贡献

     T(价格)            5.06 0.001             “价格”对回归方程有很大贡献



回归分析在游戏人气分析的实践应用探索

回归分析是研究一个变量(因变量)和另一个变量(自变量)关系的统计方法,用最小二乘方法拟合因变量和自变量的回归模型,把一种不确定的关系的若干变量转化为有确定关系的方程模型近似分析,并且通过自变量的变化来预测因变来预测因变量的变化趋势,在回归分析中两个变量的地位是不平等的,考察某一个变量的变化是依存于其他变量的变化程度,就是存在因果关系。

今天将利用回归分析对游戏数据分析的某些指标进行分析探讨,有关于回归分析的一些理论这里不再讲解,百度即可。今天针对DAU、PCU、ACU、新登等指标进行回归分析。一般而言我们可以使用Excel就能做一元回归分析,Excel做回归分析有两种方式:散点图和回归分析工具。散点图通过添加趋势线可以直观的显示自变量和因变量的关系,如果不存在明显的线性或者曲线关系,就放弃建立回归模型,趋势线能够输出方程和拟合有度(R-square,该值越接近1,方程拟合越好)。第二种方法采用回归分析工具,能够更加详细的输出回归分析指标相关信息,便于更加仔细的进行分析和预测。

回归分析分为线性回归分析和非线性回归分析,首先来看一下线性回归分析。

如果我们使用线性回归分析其实有些前提要考虑:

1)  自变量与因变量的关系,是否是呈直线,是否是一个变量依存于另个变量的变化程度,如刚才所言,变量之间的地位是不平等的。

2)  因变量是否符合正态分布。

3)  因变量数值之间是否独立。

4)  方差是否齐性。

一般来说,按照回归分析工具得出的结果来看,应着重看看残差(residual)是否是正态、独立以及方差齐性,残差就是因变量的实际值与估计值的差值。其实实际应用中,这些理论的条框我们有时候搞不懂,那么我们可以通过其他办法来看,这就是通过散点图就能把以上条框搞定。

是否呈现直线关系,通过散点图就能看出来,如下图所示,大致呈现直线关系。

[转载]鈥溁毓榉治鲡濃斺斒莘治觥⑹萃诰

对于正态分布可以考察残差的正态概率图,如果正态概率图呈现一条直线表示符合正态分布,当然了也可以通过正态性检验方法来检验一下是否符合正态分布。

[转载]鈥溁毓榉治鲡濃斺斒莘治觥⑹萃诰

是否方差齐,可以用残差的分布来看,即以因变量的预测值为x轴,以残差为y轴作图,如果残差无明显的分布,表明方差齐性。如果有一定的趋势,可能存在方差不齐的情况,如下图随着x轴的增加残差的范围逐渐增大,明显的方差不齐的情形。

[转载]鈥溁毓榉治鲡濃斺斒莘治觥⑹萃诰

对于是否独立,也可以通过图形来看, 随着时间的变化,因变量应该没有任何趋势,否则可能表明因变量之间有一定的相关性。还可通过Durbin-Watson法检验是否独立。

[转载]鈥溁毓榉治鲡濃斺斒莘治觥⑹萃诰

今天我们将探讨DAU与PCU、PCU与ACU、DAU与首登三组的回归分析。

首先来看DAU与PCU的回归分析。我们选取一个月的数据,作为分析数据,首先我们来绘制散点图(这里不具体讲解散点图绘制方法)

DAU与PCU

我们绘制散点图,并选择线性趋势线,得到如下的散点图:

[转载]鈥溁毓榉治鲡濃斺斒莘治觥⑹萃诰

之后我们通过回归分析工具进行回归分析结果的汇总来具体解析一下,操作如下:

点击数据|数据分析,如下所示:

[转载]鈥溁毓榉治鲡濃斺斒莘治觥⑹萃诰

找到回归分析

[转载]鈥溁毓榉治鲡濃斺斒莘治觥⑹萃诰

之后确定,并要把进行分析的数据引用单元格选好,残差和正态分布相关选项全部勾选,如下所示。

[转载]鈥溁毓榉治鲡濃斺斒莘治觥⑹萃诰

最后会在新的工作表组生成结果,形式如下所示:

[转载]鈥溁毓榉治鲡濃斺斒莘治觥⑹萃诰

表格术语解释一下:

df=degree of freedom 自由度

SS    Stdev square 方差

MS   Mean square  均方差

F联合检验F值

coefficient回归系数

  • 2
    点赞
  • 8
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
【为什么学习数据挖掘】       人工智能、大数据时代有什么技能是可以运用在各种行业的?数据分析就是。      从海量数据中获得别人看不见的信息,创业者可以通过数据分析来优化产品,营销人员可以通过数据分析改进营销策略,产品经理可以通过数据分析洞察用户习惯,金融从业者可以通过数据分析规避投资风险,程序员可以通过数据分析进一步挖掘出数据价值,它和编程一样,本质上也是一个工具,通过数据来对现实事物进行分析和识别的能力。不管你从事什么行业,掌握了数据分析能力,往往在其岗位上更有竞争力。【超实用的课程内容】      本课程为Python数据挖掘方向的入门课程,课程主要以真实数据为基础,详细介绍数据挖掘入门的流程和使用Python实现pandas与numpy在数据挖掘方向的运用,并深入学习如何运用scikit-learn调用常用的数据挖掘算法解决数据挖掘问题,为进一步深入学习数据挖掘打下扎实的基础。本课程分为三大部分:基础知识篇:主要讲解数据挖掘这项技能的基本工作流程和介绍和入门必须的基本技能Python语言的入门,带领大家了解数据挖掘的常见操作和基础知识。数据采集篇:学习如何解决数据挖掘的数据来源问题,读取各类型不同的数据包括CSV,excel,MySQL进行数据采集的交互。数据探索篇:本篇主要解决数据的预处理保证数据的质量并用常见数据挖掘算法进行特征提取,分析数据背后隐含的信息。【报名须知】课程采取录播模式,课程永久有效,可无限次观看课件、课程案例代码完全开放给你,你可以根据所学知识,自行修改、优化【如何开始学习?】PC端:报名成功后可以直接进入课程学习移动端:下载CSDN学院或CSDN

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值