![18f3ef7fecec41816c2088dc49a27546.png](https://i-blog.csdnimg.cn/blog_migrate/ed4bc87e20b7aeab64ba1e54f119e42f.jpeg)
编者按
logistic回归又称logistic回归分析,是一种广义的线性回归分析模型,常用于数据挖掘,疾病自动诊断等领域。例如,探讨引发疾病的危险因素,并根据危险因素预测疾病发生的概率等。以胃癌病情分析为例,选择两组人群,一组是胃癌组,一组是非胃癌组,两组人群必定具有不同的体征与生活方式等。因此因变量就为是否胃癌,值为“是”或“否”,自变量就可以包括很多了,如年龄、性别、饮食习惯、幽门螺杆菌感染等。自变量既可以是连续的,也可以是分类的。然后通过logistic回归分析,可以得到自变量的权重,从而可以大致了解到底哪些因素是胃癌的危险因素。同时根据该权值可以根据危险因素预测一个人患癌症的可能性。
1 从多元线性回归到Logistic 回归
案例
对200个不同年龄和性别的人对某项服务产品的认可的数据(logi.sav)进行分析。其中: 年龄是连续变量,性别是有男和女(分别用1和0表示)两个水平的定性变量,而变量“观点”则为包含认可(用1表示)和不认可(用0表示)两个水平的定性变量。
从下面的图可以看出什么?
![f5b133406b3a802b76ecff48aac6549b.png](https://i-blog.csdnimg.cn/blog_migrate/2cb0d96bd2297b5c005b83a40e35cf91.jpeg)
从下面这张图又可以看出什么?
![459577a3e6b0b599087afa3eeb2edccf.png](https://i-blog.csdnimg.cn/blog_migrate/ca6fd385fa79df409aaa6a8c077b084e.jpeg)
这里观点是因变量, 只有两个值;所以可以把它看作成功概率为p的Bernoulli试验的结果。但是和单纯的Bernoulli试验不同,这里的概率p为年龄和性别的函数,必须应用Logistic回归。
2 多元线性回归不能应用于定性因变量
首先,多元线性回归中使用定性因变量严重违反本身假设条件,即:因变量只能取两个值时,对于任何给定的自变量值,e本身也只能取两个值。这必然会违背线性回