Skip to content

统计推断(成对数据分析、回归与独立性检验)

一句话

回归描述趋势,检验衡量数据与假设的差异;两者都依赖抽样和模型,不能自动证明因果。

本页目标:解释回归与独立性检验的意义,区分相关、因果与概率结论。按已经学过的内容选择基础或提高题。

前置知识

  • 抽样与统计估计

    需要会:选择适当抽样方法,用样本估计总体并说明偏差和不确定性

  • 随机变量及其分布

    需要会:建立离散分布列,计算期望方差,检查独立二项模型的条件

概念与推导

本页定位:课程基础。

成对数据先看图

每个对象的一对x、y要保持对应,不能分别排序再配对。散点图先看方向、弯曲、离群点和分组;线性模型只是候选之一。相关系数r用中心化并标准化的数据衡量线性关联,符号表示方向,绝对值表示线性关联强弱;r接近0仍可能有明显非线性关系。

最小二乘为何得到这条直线

设拟合值ŷ=a+bx,残差为y−ŷ。最小二乘使残差平方和最小,避免正负误差抵消。把x、y都减均值后,平方和分成一个含截距的非负平方和一个含斜率的二次式;先令拟合线过均值点,再对斜率配方得到公式。完整代数在公式卡中,不依赖先学导数。

三个观测点一二、二二、三五与拟合线y等于一点五x。每个点向拟合线的竖直虚线表示残差,依次为二分之一、负一、二分之一。

全部x相同会使斜率分母0,无法唯一拟合斜率。即使可以拟合,也要看残差是否留下曲线、分组等系统模式。超出已观察x范围的外推需要额外依据;样本拟合很好不保证新数据也好。

独立性检验的流程

对两个分类变量,先建立行列含义明确的列联表,一人只记录一次对应结果。原假设H₀为两个分类变量独立。按行列边际计算各格期望频数,再用K²比较观察与期望差异。这里使用独立观测、大样本近似,通常每格期望至少5;小样本应改用合适的精确方法或补足数据。

本页用给定的自由度1参考阈值:显著性水平0.05时约3.841,0.01时约6.635。阈值来自χ²分布近似,不能从表格算式本身推出来。应预先选择检验规则;数据超过阈值则拒绝H₀,没有超过则不拒绝。一次检验仍可能犯错。

概率结论不要读反

在H₀为真且模型条件成立时,显著性水平控制长期重复应用规则的误拒绝比例。它不是“本次H₀为真的概率”。p值也是在H₀及模型条件下计算的尾部概率;p=0.08不等于H₀有92%的概率成立。

拒绝独立说明这份数据与独立模型存在较大差异,不证明一个变量导致另一个。没有拒绝只说明证据不足,可能受样本量、测量和设计影响。随机抽样帮助推广到总体;有良好控制的随机分配实验能为因果判断提供不同类型的证据,两者不能互相替代。

公式与条件

成对数据保持对应;拟合Sxx>0,相关系数两列均非常数;列联表边际非零、独立观测且期望频数满足近似条件。阈值和显著性水平预先说明。

y^=a+bx,b=i(xix¯)(yiy¯)i(xix¯)2,a=y¯bx¯
成立条件

有n对对应观测值,所有x不能相同,即Sxx=Σ(xᵢ−x̄)²>0。这里最小化y方向残差平方和,并包含截距。拟合本身不证明因果。

从哪里来

令uᵢ=xᵢ−x̄、vᵢ=yᵢ−ȳ。平方和可拆为Σ(vᵢ−buᵢ)²+n(a+bx̄−ȳ)²;后项由a=ȳ−bx̄取最小0。前项配方为Sxx(b−Sxy/Sxx)²+Syy−Sxy²/Sxx,故斜率取Sxy/Sxx。

适用场景与常见误用

可以用在

  • 成对数据的线性拟合

  • 在模型适用范围估计平均趋势

要防止

  • 自变量全相同时斜率不能唯一确定

  • 外推需要额外依据

  • 交换x与y后通常不是原回归直线的简单反解

知识讲解:统计推断(成对数据分析、回归与独立性检验)

AI辅助推导复核:Codex,2026-09-09。

查看课程依据及核验范围

r=i(xix¯)(yiy¯)i(xix¯)2i(yiy¯)2,1r1
成立条件

两列观测都不是常数,分母两因子均正。r描述线性关联方向与强度,不是回归斜率,也不代表因果。

取等条件

|r|=1当且仅当两列中心化向量成非零比例,即所有点落在同一条非水平、非竖直直线上。

从哪里来

把两列中心化并用各自尺度归一,使r不随正比例换单位改变。柯西不等式给Sxy²≤SxxSyy,除正分母得到|r|≤1。

适用场景与常见误用

可以用在

  • 比较线性关联方向与强弱

  • 识别负相关也可能很强

要防止

  • r接近0不排除非线性关系

  • 相关强不等于某变量导致另一变量

知识讲解:统计推断(成对数据分析、回归与独立性检验)

AI辅助推导复核:Codex,2026-09-09。

查看课程依据及核验范围

ei=yiy^i,SSE=iei2
成立条件

yᵢ为实际观测值,ŷᵢ为对应xᵢ处模型拟合值。正残差表示实际值高于预测值。

从哪里来

用观测减拟合保留偏差方向;平方后相加刻画整体拟合误差而不让正负抵消。即使总体残差和为0,也可能每个点误差很大。

适用场景与常见误用

可以用在

  • 检查模型剩余的系统模式

  • 比较同一数据上的拟合误差

要防止

  • 残差不是拟合值减观测值

  • 训练数据误差小不保证新数据预测好

知识讲解:统计推断(成对数据分析、回归与独立性检验)

AI辅助推导复核:Codex,2026-09-09。

查看课程依据及核验范围

K2=i,j(OijEij)2Eij=n(adbc)2(a+b)(c+d)(a+c)(b+d)
成立条件

表格两行为(a,b)、(c,d),n=a+b+c+d>0,行列边际均正。H₀为两分类变量独立,Eᵢⱼ=行合计×列合计/n。观测须适合独立抽样模型;通常每格期望频数至少5才使用此处自由度1的近似阈值。

从哪里来

独立假设下,用样本边际比例乘积给每格期望频数,再比较观察与期望的平方差除以期望。把四格代入可整理出右侧简式。其大样本分布近似χ²(1)是所用统计理论结论,不由代数公式本身证明。

适用场景与常见误用

可以用在

  • 给定适用条件与阈值时作独立性检验

  • 检查观察频数、期望频数和差异大小

要防止

  • 小期望频数时不能机械套近似阈值

  • 拒绝独立不证明因果

  • 未拒绝独立不等于证明独立

知识讲解:统计推断(成对数据分析、回归与独立性检验)

AI辅助推导复核:Codex,2026-09-09。

查看课程依据及核验范围

典型例题

例 1(拟合与残差)

对成对数据(1,2)、(2,2)、(3,5),求含截距的最小二乘直线,并求x=3处的拟合值和残差。

解与结论

拟合直线ŷ=3x/2;x=3处拟合值9/2,残差1/2。

  1. x̄=2、ȳ=3,Sxx=1+0+1=2,Sxy=(−1)(−1)+0+(1)(2)=3,所以b=3/2、a=0。残差5−9/2=1/2。

    为什么这样做

    按同一位置成对中心化,斜率分母是x方向平方和;残差为实际减拟合。

易错与反例
  • 不能随意重排其中一列,也不能把残差写反。

本例与题库共用题面、答案和解析。进入题组并选择独立练习或复测

例 2(按给定阈值检验)

自编列联表:甲组通过30、未通过20;乙组通过20、未通过30。假设独立抽样等适用条件满足,采用5%水平阈值3.841,进行独立性检验。

解与结论

K²=4>3.841,按该规则拒绝“组别与通过情况独立”的假设;这不证明因果。

  1. 两行各50、两列各50,总数100,各格期望25,满足期望频数条件。四格差均为±5,K²=4×25/25=4,再与给定阈值比较。

    为什么这样做

    阈值规则针对独立假设下的抽样波动;拒绝意味着数据差异较大,不是直接计算假设为假的概率。

易错与反例
  • 不能说有95%概率某组导致通过,也不能把相关解释成因果。

本例与题库共用题面、答案和解析。进入题组并选择独立练习或复测

例 3(相关不自动成为因果)

假设观察到雨伞使用数量与路面湿度正相关,就能认定多用雨伞会让路面变湿吗?

解与结论

不能,降雨可能同时影响二者。

  1. 这是观察性关联,没有排除共同因素或反向解释。需要研究设计及其他证据才能讨论因果,回归或相关系数本身不足。

    为什么这样做

    数学关联描述数据共同变化,不自动给出干预后的结果。

易错与反例
  • 不能把相关强度当成因果证据的强度。

本例与题库共用题面、答案和解析。进入题组并选择独立练习或复测

易错与反例

  • 相关系数不是斜率,负相关也可能很强。
  • 分母非零不等于统计假设有效,还要检查抽样与期望频数。
  • 未拒绝不等于证明,拒绝独立不等于证明因果。
  • p值不是原假设为真的概率。

衔接提示

练习

10 道题。先独立作答,答案和解析默认收起。

第 1 题 提高 · 示例(讲解中已出现)

对成对数据(1,2)、(2,2)、(3,5),求含截距的最小二乘直线,并求x=3处的拟合值和残差。

查看答案

拟合直线ŷ=3x/2;x=3处拟合值9/2,残差1/2。

查看逐步解析与易错点
  1. x̄=2、ȳ=3,Sxx=1+0+1=2,Sxy=(−1)(−1)+0+(1)(2)=3,所以b=3/2、a=0。残差5−9/2=1/2。

    为什么这样做

    按同一位置成对中心化,斜率分母是x方向平方和;残差为实际减拟合。

易错与反例

  • 不能随意重排其中一列,也不能把残差写反。

本机记录

来源:自编。 需推理复核;未自动验证展示答案。 AI辅助逐题复核:Codex,2026-09-09。

回补:统计推断(成对数据分析、回归与独立性检验)。一道题出错只提供候选线索。

第 2 题 提高 · 示例(讲解中已出现)

自编列联表:甲组通过30、未通过20;乙组通过20、未通过30。假设独立抽样等适用条件满足,采用5%水平阈值3.841,进行独立性检验。

查看答案

K²=4>3.841,按该规则拒绝“组别与通过情况独立”的假设;这不证明因果。

查看逐步解析与易错点
  1. 两行各50、两列各50,总数100,各格期望25,满足期望频数条件。四格差均为±5,K²=4×25/25=4,再与给定阈值比较。

    为什么这样做

    阈值规则针对独立假设下的抽样波动;拒绝意味着数据差异较大,不是直接计算假设为假的概率。

易错与反例

  • 不能说有95%概率某组导致通过,也不能把相关解释成因果。

本机记录

来源:自编。 需推理复核;未自动验证展示答案。 AI辅助逐题复核:Codex,2026-09-09。

回补:统计推断(成对数据分析、回归与独立性检验)。一道题出错只提供候选线索。

第 3 题 提高 · 示例(讲解中已出现)

假设观察到雨伞使用数量与路面湿度正相关,就能认定多用雨伞会让路面变湿吗?

查看答案

不能,降雨可能同时影响二者。

查看逐步解析与易错点
  1. 这是观察性关联,没有排除共同因素或反向解释。需要研究设计及其他证据才能讨论因果,回归或相关系数本身不足。

    为什么这样做

    数学关联描述数据共同变化,不自动给出干预后的结果。

易错与反例

  • 不能把相关强度当成因果证据的强度。

本机记录

来源:自编。 需推理复核;未自动验证展示答案。 AI辅助逐题复核:Codex,2026-09-09。

回补:统计推断(成对数据分析、回归与独立性检验)。一道题出错只提供候选线索。

第 4 题 提高 · 独立练习

成对数据(2,3)、(2,4)、(2,5)能唯一确定含截距最小二乘直线的斜率吗?

查看答案

不能;所有x相同,Sxx=0。任意经过(2,4)的非竖直直线都有相同最小残差平方和。

查看逐步解析与易错点
  1. 此时数据只约束a+2b的拟合值。其最优值为y均值4,因此a=4−2b而b任意。

    为什么这样做

    自变量没有变化,无法从这组数据识别响应随x变化的线性斜率。

易错与反例

  • 不能把公式0/0当成斜率0。

本机记录

来源:自编。 需推理复核;未自动验证展示答案。 AI辅助逐题复核:Codex,2026-09-09。

回补:统计推断(成对数据分析、回归与独立性检验)。一道题出错只提供候选线索。

第 5 题 基础 · 独立练习

回归模型ŷ=2+3x,观测点为(2,9)。依次求该点拟合值与残差。

查看答案

(8,1)

查看逐步解析与易错点
  1. 拟合值2+3×2=8;残差9−8=1。

    为什么这样做

    正残差表示实际值高于模型给出的值。

易错与反例

  • 残差1不是函数值9,也不是斜率3。

本机记录

来源:自编。 断言已执行并通过,读取结构化答案。 AI辅助逐题复核:Codex,2026-09-09。

回补:统计推断(成对数据分析、回归与独立性检验)。一道题出错只提供候选线索。

第 6 题 基础 · 独立练习

在两列数据均非常数且计算有效时,r=−0.9最恰当的解释是哪项?

  • A.

    几乎没有关联,因为r是负数

  • B.

    有较强负线性关联,但不能据此认定因果

  • C.

    x每增1,y必减0.9

  • D.

    所有点完全在一条直线上

查看答案

B

查看逐步解析与易错点
  1. 符号表示方向,|r|=0.9表示线性关联较强;r不带斜率的单位,也不是确定性关系。

    为什么这样做

    相关系数与斜率、因果是不同概念。

易错与反例

  • 不能把负号当作强度弱。

本机记录

来源:自编。 断言已执行并通过,读取结构化答案。 AI辅助逐题复核:Codex,2026-09-09。

回补:统计推断(成对数据分析、回归与独立性检验)。一道题出错只提供候选线索。

第 7 题 提高 · 独立练习

列联表两行为(1,0)、(0,1)。能直接用自由度1、5%阈值3.841的常见大样本近似作判断吗?

查看答案

不应机械使用;每格期望只有0.5,未满足这里的近似条件。

查看逐步解析与易错点
  1. n=2,行列合计均1,所以期望1×1/2=0.5。应增加合适数据或采用适用于小样本的精确方法。

    为什么这样做

    公式可计算与近似检验的适用性是两件事。

易错与反例

  • 观察格为0本身不是唯一问题,要检查期望频数与抽样设计。

本机记录

来源:自编。 需推理复核;未自动验证展示答案。 AI辅助逐题复核:Codex,2026-09-09。

回补:统计推断(成对数据分析、回归与独立性检验)。一道题出错只提供候选线索。

第 8 题 提高 · 独立练习

某项有效独立性检验的p值为0.08,预先选定显著性水平0.05。该如何解释?

查看答案

不拒绝独立假设,但不能据此证明独立,也不能说独立的概率为0.92。

查看逐步解析与易错点
  1. 0.08大于预先阈值,没有达到拒绝规则。p值是在独立假设及模型条件下,出现至少如此极端统计量的概率。

    为什么这样做

    p值的条件是先假设H₀成立,不是看完数据后H₀为真的概率。

易错与反例

  • 不要把未发现显著差异解释成已经证明无差异。

本机记录

来源:自编。 需推理复核;未自动验证展示答案。 AI辅助逐题复核:Codex,2026-09-09。

回补:统计推断(成对数据分析、回归与独立性检验)。一道题出错只提供候选线索。

第 9 题 基础 · 独立复测

对数据(0,1)、(1,3)、(2,5),拟合ŷ=a+bx,依次求b、a。

查看答案

(2,1)

查看逐步解析与易错点
  1. x̄=1、ȳ=3;Sxx=2,Sxy=(−1)(−2)+(1)(2)=4,所以b=2、a=1。

    为什么这样做

    拟合线经过均值点,且本例所有点恰在同一条线上。

易错与反例

  • 三点完美拟合不自动保证未来数据也严格在线上。

本机记录

来源:自编。 断言已执行并通过,读取结构化答案。 AI辅助逐题复核:Codex,2026-09-09。

回补:统计推断(成对数据分析、回归与独立性检验)。一道题出错只提供候选线索。

第 10 题 提高 · 独立复测

独立性检验表两行为(24,16)、(16,24),模型适用。以5%阈值3.841作判断。

查看答案

K²=3.2<3.841,不拒绝独立假设,不能据此证明独立。

查看逐步解析与易错点
  1. 总数80,行列合计各40,每格期望20。四格偏差±4,所以K²=4×16/20=3.2。

    为什么这样做

    观察差异需与抽样波动对应的既定规则比较,未越过阈值只是不足以拒绝。

易错与反例

  • 不能因为两行比例不同就必定拒绝,也不能反向把未拒绝当证明。

本机记录

来源:自编。 需推理复核;未自动验证展示答案。 AI辅助逐题复核:Codex,2026-09-09。

回补:统计推断(成对数据分析、回归与独立性检验)。一道题出错只提供候选线索。

后继知识

本轮未登记直接后继,可用独立练习检验迁移能力。

依据

课程依据:高中:统计与推断。已定位原件主题,非全文逐字审定,核验范围与日期见引用中心。

教材版本与映射 · 纠错记录。具体学习安排须结合所用教材及已具备的能力。