明星(如fsf)到底有没有出轨?Logistic回归模型告诉你
明星恋情和婚姻是吃瓜群众们经常讨论的话题如最近的fsf疑似出轨事件zly的粉丝众多和传言将要复出fsf几度被送上热搜。身边的朋友也经常讨论这个话题并且意见不一。于是数学君想到了功能强大的Logistic模型并费了九牛二虎之力找到了Logistic模型的样本数据预测出了fsf出轨的概率。不了解Logistic回归模型的粉丝可能会问这个Logistic模型预测的结果可信不可信准确率又有多高下面请耐心的听数学君说给你们听。Ps如果你不关心模型和预测的过程只关心结果请直接滑动到文章末尾。Logistic模型是个什么玩意寻找一个连续型因变量与一个或多个自变量关系的模型大家应该不陌生如常见的一元线性回归模型ya*xb。但很多时候我们关心的因变量y的取值只有两种可能是或否。如某人会不会得癌症某个贷款人会不会违约某个明星到底有没有出轨这个时候一般的预测连续型因变量的模型就不适用了而Logisic回归模型就可以被派上用场了。Logistic回归本质上是一种广义的线性回归模型可以根据一个或多个一般是多个连续型或类别型自变量来预测只有两个输出结果的因变量的值。Logistic模型预测婚外情事件的质量怎么样模型预测结果的质量怎么样至少取决于两点一是模型的适用性二是预测变量或称为自变量和样本的代表性。第一个问题显然是没有疑问的是否有婚外情只有是或否两种结果适用于Logistic模型。第二个问题你也不用担心预测变量的选取和样本取自《今日心理》Psychology Today在1969年所做的一个非常有代表性的调查参与者数量为601个采集的预测变量包括近一年内婚外情频率、参与者的性别、年龄、婚龄、是否有小孩、宗教信仰程度5分制1表示非常反对5表示非常信仰、学历、职业戈登的7种分类逆向编号、婚姻幸福度5分制1表示非常不幸福5表示非常幸福。有了适用的模型、充分的预测变量和足够的样本代表性模型质量就有了初步的保证。下面我们看样本的预测结果和真实结果对比的效果如何。加载样本数据集Affairs并查看数据结构结果如下。我们可以看到样本数据集中包含的变量有affairs、gender、age…rating婚姻幸福度等并且可以看到近一年内婚外情次数最多的为12次有38个人有451个人没有婚外情。样本数据集中affairs是我们需要预测的因变量并且是一个二值型因变量需要对affairs的值进行处理将其改为二值型变量ynaffiars即将affairs1的值全部改为10保持不变即有1次婚外情即为有婚外情用ynaffairs1表示没有婚外情用ynaffairs0表示。将affairs修改为ynaffairs后并重新统计ynaffairs各个取值出现的频数结果如下ynaffairs和上面的所有因变量gender、age、yearsmarried…等都相关吗先做一个ynaffairs和所有自变量关系的回归模型。结果显示ynaffairs与性别、是否有孩子、学历、职业的相关性都不显著而与年龄、婚龄、宗教信仰、婚姻幸福度的相关性是显著的。剔除相关性不显著的变量后对与婚外情显著相关的变量再做一次logistic回归。从以上结果可以看出新模型fit.reduced拟合的效果很好在0.05的显著性水平上各因变量的回归效果均显著即婚外情与年龄、婚龄、宗教信仰、婚姻幸福度的相关性都很显著。通过anova()函数对新模型fit.reduced和旧模型fit.full进行卡方检验发现两个模型拟合的效果一样好p0.21080.05说明两个模型拟合的效果没有显著性差异某明星fsf到底有没有出轨呢我们把fsf的相关信息输入到模型中进行预测通过网上公开资料得到fsf的相关信息age41yearsmarried 1 religiousness1rating有的粉丝可能觉得婚姻幸福度这个变量外人较难以判定所以我们把婚姻幸福度从1到5的值都试一遍fsf到底有没有出轨呢这里不方便公布啦数学君还不想通过数据科学将别人的隐私直接公布到网上。迫切想知道的朋友可以在公号“数学算法的世界”后台回复“fsf” 即可获得婚姻幸福度从1到5时fsf出轨的概率先预告一下婚姻的幸福越高婚外情的概率越低。想通过Affairs数据和Logistic模型预测其他自己关注人物的affairs概率的话在后台回复 “Affairs” 即可获得 Affairs数据集然后就可以满足一下自己的好奇心了。数学算法的世界数据分析|PythonR|SQL|Excel|科普