分享好友 站长动态首页 网站导航

对数据进行线性回归分析

网友发布 2022-07-30 16:25 · 头闻号创业故事

案例描述

根据对不同人群创业思想的调查,认为创业的可能性可能分为科技发展、社会资源、教育水平三个维度。三个维度中的分析项目都是量表题,创业的可能性也是由量表题组成的。病例数据还包括性别、年龄等基本个体特征,有200个数据样本。本案例的主要分析目的是研究技术发展、社会资源和教育水平对创业可能性的影响。

数据处理

在进行数据分析之前,首先我们需要对数据进行核对。案例是问卷数据,所以常用的方法有用SPSSAU描述分析数据是否正态,散点图,箱线图。

判断异常值的标准如下:

检查数据是否有异常值的方法:

异常值处理方法:

在这种情况下,异常值的参考标准大于3个标准差。

使用描述性分析没有发现异常值。

除了处理异常值,还需要处理变量。由于问卷中的多个尺度代表一个问题,因此将这些尺度合并到一个维度中进行分析:

比如“我意识到技术发展对创业的好处”“我认为技术发展让创业变得更容易”“我认为网络创业在中国会成为一种趋势”“我以后可能会把科技行业作为创业的起点”。四个尺度问题可以表示利用SPSSAU数据处理中生成的变量可以完成“技术发展”,如图:

“我认为社会关系对创业很重要”、“拥有良好的社会关系可以帮助创业者成就一番事业”、“没有良好的社会关系会影响创业活动的成功”。三个量表问题可以表示“社会资源”,如图所示:

其他变量也是如此。在处理变量后,分析前需要检查基本关系,如散点图、相关性分析,观察因变量和自变量是否有线性特征和相关性。以下逐一解释。

基本关系视图

1.散点图

用SPSSAU“可视化”→“散点图”做数据的散点图,观察因变量和自变量之间是否存在线性关系。

从上图可以看出,创业可能性、受教育程度、社会资源和科技发展之间存在线性关系,其中Y轴为因变量创业可能性,X轴为自变量。接下来看数据的相关性。

2.相关分析

相关分析是研究有没有关系,回归分析是研究影响关系。显然,相关性分析是基础,然后才是回归分析。首先,你需要知道有没有相关性;有相关性才有回归影响关系;如果没有相关性,应该没有回归影响。

从上表可以看出,相关性分析用于研究创业可能性、社会资源、教育水平和科技发展之间的相关性,皮尔逊相关系数用于表示相关性的强弱。具体分析表明,创业可能性与受教育程度显著相关,相关系数值分别为0.232,均大于0,说明创业可能性与受教育程度正相关。同时,创业可能性与社会资源、科技发展没有显著关系,相关系数接近0,说明创业可能性与社会资源、科技发展没有相关性。与相关回归没有100%的联系。从模型完整性的角度来看,不相关的变量也可以纳入模型进行分析。但如果没有相关性,就不应该有回归影响关系。

线性回归结果

在检查完基本关系后,我们切入正题,利用SPSSAU通用方法的线性回归进行回归分析。接下来说明回归结果,包括模型效果和模型结果。如下所示:

此外,该模型还包括性别和年龄控制变量,这些变量指的是可能干扰模型的项目,如年龄、教育程度和其他基本信息。从软件的角度来说,没有“控制变量”这个术语。“受控变量”是自变量,直接放在“自变量x”框里就行了。此外,控制变量通常是分类数据。理论上需要将控制变量设置为“虚拟变量”,但实际研究中很少这样做,直接放入模型中。可能的原因是“控制变量”不是核心研究项,不必考虑得太复杂。

1.模型效应

f检验

从上表可以看出,离差平方和为162.149,残差平方和为152.062,回归平方和为10.086。在回归方程的显著性检验中,统计量F=2.574,对应的P值小于0.05,被解释变量的线性关系显著,可以建立模型。建立模型后,需要检查模型的拟合优度是否ok,其中可以检查R平方,调整R平方值。

适合度

从上表可以看出,社会资源、教育水平、科技发展作为自变量,创业可能性作为因变量进行线性回归分析。从上表可以看出,模型的R平方值为0.062,调整后的R平方值为0.038,其中R平方为决定系数,为模型拟合指数。Y的波动有多大比例可以用X的波动来描述?R-square平差也是一个模型拟合指数。当x的数量较大时,调整R比调整R更准确,说明社会资源、教育水平、科技发展程度可以解释创业可能性6.2%的变化。可以看出,模型的拟合优度一般,说明解释变量中能被模型解释的部分较少。接下来,检查变量是否多重共线性。

补充说明:

R的平方值表示模型的拟合能力。比如0.3表示自变量X对因变量y有30%的解释力,这个值在0到1之间,越大越好。但实际研究中并没有固定的标准。有些专业可以是0.1甚至0.05,但有些专业往往出现在0.8以上。一般来说,你只需要报这个值,不要太在意它的大小,因为很多时候,我们更关心的是X对y有没有影响。

多重共线性

VIF值用于检测共线性。通常,如果VIF值小于10,则表示不存在共线性。有时,公差值被用作标准,公差值=1/VIF。因此,如果容差值大于0.1,则表示不存在共线性,因此VIF和容差值之间存在逻辑对应关系,可以从两者中选择一个。一般来说,你可以描述VIF价值。在【线性回归】分析中,SPSSAU会智能判断共线性问题,并提供解决方案。从结果可以看出,变量的VIF值都小于5,所以在这种情况下不存在多重共线性问题。

但如果存在多重共线性问题,建议三种解决方法:一是使用逐步回归分析;第二种是用岭回归分析,第三种是进行相关性分析,手工去掉相关性非常高的分析项,再做线性回归分析。

模型的自相关性解释如下。

自相关

D-W的值为2.086,接近数字2,说明模型没有自相关,样本数据之间没有相关性,模型是好的。

D-W值也叫德宾-沃森值。通常,时间序列分析会考虑DW值:

当残差和自变量相互独立时,dw≈2;

当两个相邻点的残差正相关时,DW2;

2.模型结果

回归的中间过程包括f检验、拟合优度、多重共线性和自相关,这些都需要在分析之前进行观察和分析。接下来将从模型公式、分析结果、影响关系等方面对模型结果进行说明。

模型公式

从上表可以看出,教育水平、社会资源、科技发展、性别、年龄作为自变量,创业可能性作为因变量进行线性回归分析。从上表可以看出,模型公式为:创业可能性=2.114+0.251*受教育程度+0.026*社会资源+0.013*科技发展-0.172*性别+0。

分析结果

最终分析表明,教育程度的回归系数值为0.251,这意味着教育程度会对创业可能性产生显著的正向影响。社会资源的回归系数值为0.026,说明社会资源不会对创业可能性产生影响。科技发展的回归系数为0.013,说明科技发展不会影响创业可能性。性别回归系数的值为-0.172,说明性别对创业可能性没有影响。年龄的回归系数为0.024,说明年龄对创业可能性没有影响。从分析中可以看出,受教育程度会对创业的可能性产生显著的正向影响。而社会资源、科技发展、性别、年龄对创业的可能性没有任何影响。

影响关系大小

如果自变量X对因变量Y产生了显著的影响,而你想比较这种影响,建议用标准化系数值来比较这种影响。当β值大于0时,会产生正面影响。数值越大,影响越大。当β值小于0时,有负面影响。值越小,影响越大。如上图,回归方程的常数项约为2.114,教育水平、社会资源、科技发展、性别和年龄的标准化系数分别为0.218、0.022、0.011、-0.085和0.021。可见,模型中的受教育程度对创业的可能性影响很大。

其他的

此外,SPSSAU还提供了线性回归分析的结果——简化格式和coefPlot。

CoefPlot显示具体的回归系数值和对应的置信区间,可以直观地检查数据的显著性。如果置信区间包含数字0,说明该项不显著;如果置信区间不包括数字0,则意味着该项目是重要的。所以上图中,只有学历不包括0,意义重大。接下来,测试分析模型的稳健性。

鲁棒性测试

稳健性检验是指模型的稳定性。使用各种形式时,模型是稳定的,该显著的项目仍然显著,不显著的项目仍然不显著。一般建议考虑在线性回归中加入控制变量,在不加入控制变量的情况下比较模型的稳定性。当然,也可以使用线性回归、逐步回归、层次回归等多种研究方法。,来检验同一个变量的显著性是否发生了变化。如果它在任何情况下都是稳定的或者很少变化,则表明该模型是稳健的。该方法描述如下:

在该分析中,选择第一种分析方法,并对放置控制变量和不放置控制变量进行比较:

教育水平将对创业可能性产生显著的积极影响。但是社会资源和科技的发展并不会影响创业的可能性。可以得出结论,模型是稳健的,自变量的显著性没有改变。

摘要

研究科技发展、社会资源、受教育程度对创业可能性的影响。首先,对数据进行处理,包括异常值和尺度问题,以形成维度。然后,检查基本关系,包括线性关系和相关关系。在分析过程中,控制变量被添加到模型中。从模型效应和模型结果两个方面发现,受教育程度会对创业的可能性产生显著的正向影响。而社会资源、科技发展、性别、年龄对创业的可能性没有任何影响。稳健性检验采用添加控制变量或不添加控制变量的方法,发现模型是稳健的。分析结束。

免责声明:本平台仅供信息发布交流之途,请谨慎判断信息真伪。如遇虚假诈骗信息,请立即举报

举报
反对 0
打赏 0
更多相关文章

评论

0

收藏

点赞