SPSS相关分析与回归分析:从散点图到非线性模型的完整指南

发布时间:2026/9/19 18:56:07
SPSS相关分析与回归分析:从散点图到非线性模型的完整指南
简介这份SPSS相关分析与回归分析PPT课件面向统计学、数据分析初学者及需要完成课程作业或论文实证的高校学生帮助系统掌握变量间关系的测度与建模方法。课件围绕相关分析与回归分析两大主线展开涵盖函数关系与统计关系的区分、线性与非线性相关类型、散点图绘制、Pearson与Spearman及Kendall三种相关系数的计算与检验以及回归模型的适用性检验、参数检验和非线性回归等内容并配有SPSS菜单操作步骤与人均GDP与移动电话普及率等应用举例。资源包共1个pptx文件约348KB结构紧凑按概述、相关分析、回归分析等模块逐页推进共68页便于课堂讲授或自学对照。目前已有94人学习适合希望用一份课件快速理清相关与回归分析知识框架、并同步掌握SPSS操作路径的读者参考使用。1. 从一份 68 页课件说起相关分析与回归分析到底在解决什么问题很多人第一次打开 SPSS 的相关分析菜单是被导师或业务方一句“看看这两个变量有没有关系”推过去的。点完Analyze - Correlate - Bivariate出来一张相关系数矩阵看到 0.83 就以为大功告成结果被追问“控制了收入之后还相关吗”“这个关系是线性的吗”就答不上来。这份 68 页的 SPSS 相关分析与回归分析课件价值恰恰在于它把这条链路拆得很细先讲相关关系与函数关系的区别再讲散点图与相关系数接着是偏相关、回归模型检验、适用性判断最后落到非线性回归。它适合三类人一是统计课要交作业、需要照着菜单一步步复现的学生二是做用户增长、运营分析手里有 Excel 或 CSV 但不确定该用 Pearson 还是 Spearman 的从业者三是已经会用lm()但想搞清楚 SPSS 输出表里每个数字含义的人。核心结论先摆在这相关分析只回答“强弱和方向”回归分析才回答“变化多少”而偏相关回答的是“排除干扰后还剩多少”。三者不能互相替代选错方法比算错数字更致命。2. 相关分析散点图、Pearson 与 Spearman 的选型逻辑2.1 先画散点图再谈相关系数课件里把“绘制散点图”放在“计算相关系数”之前这个顺序不是排版随意。相关系数是一个被压缩成单值的指标它会掩盖非线性、离群点和分组结构。Anscombe 四组数据就是经典反例四组数据的相关系数都约等于 0.816但散点图形状完全不同。所以正确流程是先用图形看形态再用系数定量。SPSS 里的操作路径是Graphs - Legacy Dialogs - Scatter/Dot - Simple Scatter。把自变量放 X 轴、因变量放 Y 轴如果数据里有省份、行业这类分类字段可以放进Set Markers by用不同颜色区分想把省份名称直接标在点上放进Label Cases by。这一步做完你至少能判断三件事关系是不是单调、有没有明显的弯折、有没有一两个点孤零零地飘在外面。2.2 Pearson、Spearman、Kendall 怎么选课件把三种相关系数的适用场景讲得很清楚但实际选型时容易混。判断依据是变量的测量尺度而不是“哪个结果显著用哪个”。相关系数适用数据类型前提假设典型场景Pearson定距/定比连续变量线性关系、近似正态、无极端值人均 GDP 与移动电话普及率Spearman定序变量或连续但非正态单调关系即可年龄段与收入段、职称与受教育年限Kendall定序变量样本量较小单调关系基于一致对小样本排序一致性、评委打分Pearson 的公式是协方差除以两个标准差的乘积本质是标准化后的共变程度。Spearman 则是把原始值换成秩之后再算 Pearson所以它对极端值不敏感只要单调关系成立就能捕捉。Kendall 用的是“一致对”和“非一致对”的差值样本量小的时候比 Spearman 更稳健但计算量随 n 平方增长。2.3 用 SPSS 语法批量算相关系数菜单点一次只能出一张表做多组变量时用语法更省事。下面这段语法同时输出 Pearson 和 Spearman并带上均值、标准差和协方差CORRELATIONS /VARIABLESGDP phone_penetration income consumption /PRINTTWOTAIL NOSIG /STATISTICSDESCRIPTIVES XPROD /MISSINGPAIRWISE. NONPAR CORR /VARIABLESage income education /PRINTSPEARMAN TWOTAIL NOSIG /MISSINGPAIRWISE./PRINTTWOTAIL NOSIG表示输出双尾检验但隐藏显著性标记适合先看整体/STATISTICSDESCRIPTIVES XPROD会额外给出均值、标准差、离差平方和与协方差方便手算验证/MISSINGPAIRWISE是成对剔除缺失值比整行剔除保留更多样本但要注意不同变量对的 n 可能不同。NONPAR CORR是专门算非参数相关的命令/PRINTSPEARMAN指定输出 Spearman换成KENDALL就是 Kendall。2.4 相关系数检验与 p 值的正确读法课件强调“抽样的随机性、样本容量小”会导致样本相关不能直接推断总体相关所以必须做检验。SPSS 输出里每个系数后面跟着Sig.就是相伴概率 p。判断规则是p ≤ α 拒绝零假设总体零相关p α 不能拒绝。输出里的*表示 p ≤ 0.05**表示 p ≤ 0.01**比*更可靠。这里有个常见误用把 p 值当成相关强度的证据。p 小只说明“不太可能是零相关”不代表关系强。样本量上万时r 0.05 也可能显著。所以报告时要同时给 r 和 p再结合散点图。另外课件特别提醒极端值的影响(1,1)(2,2)(3,3)(4,4)(5,5)(6,1)这组数据 r 只有 0.33但去掉最后一个点就是完全正相关。遇到这种情况先查数据录入错误再考虑用 Spearman 或稳健方法。3. 偏相关分析控制混杂变量后的“净相关”3.1 虚假相关是怎么产生的课件举了两个例子小学生速算比赛里身高和分数的相关其实受年龄影响商品需求量和价格的相关混入了消费者收入的作用。这类“看起来相关、实际是第三个变量在推动”的现象就是虚假相关。偏相关的作用就是在统计上把控制变量“固定住”再看两个目标变量还剩多少相关。一阶偏相关的公式是r_xy.z (r_xy - r_xz * r_yz) / sqrt((1 - r_xz^2)(1 - r_yz^2))分子是原始相关减去两条“绕路”相关的乘积分母是两条绕路的残差标准化。直观理解先把 x 和 y 各自对 z 做回归取残差再算两个残差的相关。控制变量越多阶数越高公式越复杂但 SPSS 会直接算。3.2 SPSS 偏相关操作与语法菜单路径是Analyze - Correlate - Partial。把要分析的两个变量放进Variables把控制变量放进Controlling for。语法版本PARTIAL CORR /VARIABLESdemand price BY income /SIGNIFICANCETWOTAIL /STATISTICSDESCRIPTIVES /MISSINGLISTWISE./VARIABLESdemand price BY income里BY前面是目标变量对后面是控制变量。/STATISTICSDESCRIPTIVES输出均值、标准差和样本量方便判断控制后样本是否骤减。/MISSINGLISTWISE是整行剔除偏相关对缺失值敏感因为每个控制变量都要参与计算成对剔除会导致不同阶数的样本不一致所以这里用整行剔除更稳妥。3.3 偏相关结果的解读边界偏相关输出的是r、自由度df和Sig.。自由度等于 n - 2 - 控制变量个数。解读时要注意控制变量本身如果和目标变量高度共线偏相关会不稳定甚至出现符号反转。比如收入和价格高度相关时控制收入后需求量和价格的偏相关可能从负变正这不是数据错了而是“净效应”和“总效应”本来就可以不同。提示偏相关只能控制你测量到的变量。没测到的混杂因素偏相关无能为力。所以报告偏相关时要说明控制了哪些变量以及为什么选这些变量。4. 线性回归模型检验、适用性与 SPSS 输出精读4.1 从相关到回归表达式与最小二乘相关分析给出 r回归分析给出方程y b0 b1*x1 ... bk*xk e。SPSS 用最小二乘法估计系数目标是让残差平方和最小。菜单路径Analyze - Regression - Linear把因变量放Dependent自变量放Independent(s)。语法REGRESSION /DESCRIPTIVES MEAN STDDEV CORR SIG N /MISSING LISTWISE /STATISTICS COEFF OUTS R ANOVA CHANGE /CRITERIAPIN(.05) POUT(.10) /NOORIGIN /DEPENDENT consumption /METHODENTER income age education./METHODENTER是强制进入法所有自变量同时进入适合理论驱动的研究/STATISTICSCOEFF OUTS R ANOVA CHANGE输出系数、模型摘要、方差分析表和 R 方变化量/CRITERIAPIN(.05) POUT(.10)是逐步回归的进入和剔除标准用 ENTER 时不生效但保留着方便切换。4.2 模型检验三张表怎么读SPSS 回归输出核心是三张表。第一张Model Summary给 R、R 方、调整 R 方和标准误。R 方是解释的变异比例调整 R 方惩罚了自变量个数做多元回归时看调整 R 方更靠谱。第二张ANOVA给 F 统计量和Sig.检验的是“所有系数是否同时为零”F 显著只说明模型整体有用不代表每个自变量都显著。第三张Coefficients给每个变量的 B、标准误、Beta、t 和Sig.。B 是未标准化系数带单位Beta 是标准化系数可以跨变量比较相对重要性。课件里提到的“回归模型的适用性检验”在 SPSS 里主要看残差。Plots选项里勾选Histogram和Normal probability plot看正态性勾选ZRESID对ZPRED看残差是否随机分布。如果残差图呈喇叭形说明方差不齐呈 U 形说明线性假设不成立该考虑非线性项了。4.3 多重共线性与异常值排查多元回归最容易踩的坑是共线性。SPSS 在Statistics里勾选Collinearity diagnostics会输出 VIF 和 Tolerance。经验规则VIF 10 或 Tolerance 0.1 就要警惕。处理办法是删掉冗余变量、合并变量或者改用岭回归、主成分回归。异常值用Casewise diagnostics看默认标记标准化残差超过 ±3 的个案。发现异常值先别急着删查清楚是录入错误还是真实极端情况。真实极端值可以考虑稳健回归或者单独报告敏感性分析。REGRESSION /MISSING LISTWISE /STATISTICS COEFF OUTS R ANOVA COLLIN TOL /CRITERIAPIN(.05) POUT(.10) /NOORIGIN /DEPENDENT consumption /METHODENTER income age education /RESIDUALS DURBIN HISTOGRAM(ZRESID) NORMPROB(ZRESID) /CASEWISE PLOT(ZRESID) OUTLIERS(3).COLLIN TOL输出共线性诊断DURBIN输出 Durbin-Watson 统计量检验残差自相关接近 2 为佳CASEWISE OUTLIERS(3)列出标准化残差超过 3 的个案。5. 非线性回归与模型比较从多项式到曲线估计5.1 什么时候该放弃线性模型残差图出现系统性弯曲、散点图明显不是直线、理论上有饱和或加速效应时线性模型就不够用了。课件提到的多项式回归、指数回归、对数回归在 SPSS 里对应Analyze - Regression - Curve Estimation。这个菜单可以一次拟合线性、对数、二次、三次、指数、幂等多种曲线并输出各自的 R 方方便比较。CURVEFIT /VARIABLESdemand price /CONSTANT /MODELLINEAR QUADRATIC CUBIC EXPONENTIAL LOGARITHMIC POWER /PLOT FIT./MODEL后面列出要拟合的曲线类型/PLOT FIT会画出拟合曲线叠加在散点图上。输出里比较各模型的 R 方和 F 值但要注意不同曲线类型的因变量变换方式不同R 方不能直接跨类型比较。比如指数模型实际拟合的是ln(y)它的 R 方是变换后的和线性模型的 R 方不在同一尺度。稳妥做法是看拟合图或者把预测值还原到原始尺度再算 RMSE。5.2 多项式回归的阶数与过拟合多项式回归用y b0 b1*x b2*x^2 ...逼近曲线。阶数越高拟合越灵活但过拟合风险越大。常见做法是先用二次项看有没有显著改善再考虑三次。SPSS 里可以用Transform - Compute Variable生成x**2、x**3再放进线性回归也可以直接用 Curve Estimation 的 QUADRATIC、CUBIC。判断是否过拟合看调整 R 方是否随阶数增加而持续上升以及高阶项系数是否显著。如果三次项不显著、调整 R 方也没提升就退回二次。另一个技巧是中心化把 x 减去均值再平方可以降低高阶项和低阶项之间的共线性让系数更稳定。5.3 用嵌套模型 F 检验比较拟合优度比较两个嵌套模型比如线性 vs 二次不能只看 R 方变大要用 F 检验。公式是F ((RSS_small - RSS_big) / (df_small - df_big)) / (RSS_big / df_big)SPSS 线性回归的R Square Change表在/STATISTICSCHANGE时输出直接给出 R 方变化量、F 变化量和显著性。操作上分两步第一步只放线性项第二步加入二次项看 Change Statistics 里的Sig. F Change。如果小于 0.05说明二次项带来了显著改善。注意非线性回归的系数解释和线性不同。二次项系数为正表示开口向上为负表示开口向下拐点在-b1/(2*b2)。报告时要结合业务含义说明拐点位置而不是只报显著性。5.4 一个可复现的完整流程把上面的步骤串起来一个完整的分析流程是先Graphs - Scatter看形态用CORRELATIONS算 Pearson 和 Spearman有混杂变量就上PARTIAL CORR确定线性关系后用REGRESSION建模型读 Model Summary、ANOVA、Coefficients 三张表查 VIF 和残差图残差有弯曲就转CURVEFIT比较曲线或用多项式加项做嵌套 F 检验。每一步都保留语法文件换一批数据只需改/VARIABLES和/DEPENDENT这是用 SPSS 做可复现分析最省力的方式。本文还有配套的精品资源点击获取