Skip to content

抽样与统计估计

一句话

统计估计先问样本从哪里来;计算给出估计值,抽样设计决定能够推广到哪里。

本页目标:选择适当抽样方法,用样本估计总体并说明偏差和不确定性。按已经学过的内容选择基础或提高题。

前置知识

概念与推导

本页定位:课程基础。

总体、样本与想回答的问题

总体是研究对象的全体,样本是实际观察的一部分。总体均值、比例是待了解的参数,样本均值、比例是由已观察数据计算的统计量。先界定对象、时间、地区和测量单位,再选择抽样方法;调查“本校本学期”不能直接回答“所有学校长期如此”。

普查覆盖全体,抽样节省成本,但要接受不确定性。即使抽样合适,换一组样本也可能得到不同估计。应记录样本量、方法和未回应情况,不能把估计当成精确清点。

简单随机、分层与系统抽样

简单随机抽样要求每个同容量样本有相同机会;仅每个人入样概率相同还不够,例题后的练习给出反例。实际可给完整名册编号,用可靠随机机制无重复抽取,避免把“随手选”称为随机。

分层抽样先把总体分成互斥且覆盖全部的层,再在每层随机抽取。按比例分配时,层内样本量约为总样本量乘该层总体占比;若取整,需要说明调整并核对总量。层内样本均值合并时使用总体权重;若样本故意不按比例分配,不能直接平均所有回收数据来替代加权估计。

总体分为百分之六十与百分之四十两层,从五十人样本中按比例分配三十与二十人;每层内部仍须随机选择,再按总体层权重合并估计。

系统抽样可在有序名册上随机选起点后等间隔取人。若排序周期与间隔重合,可能产生很大抽样误差;随机起点不保证每个实际样本都能很好代表总体。它与简单随机抽样的样本分布也不同。

估计、偏差与波动

样本比例m/n可用于估计目标总体比例;总体人数已知时可再乘N估计数量。描述均值、方差时要明确口径:本页沿用除以n的描述性方差。用于估计总体方差的其他约定如除以n−1,依赖另外的模型与目标,不在同一题中悄悄更换。

样本量增加通常能减小适当随机抽样下的波动,但不能自动纠正只问爱好者、只收自愿回复、题目带诱导或测量工具偏移等问题。分层也不会自动消除层内偏差。推断时将“观察到什么”和“在何种假设下推广”分别写清。

与后续统计推断的连接

抽样给回归与检验提供数据基础。随机抽样主要支持向总体推广;随机分配处理主要帮助比较因果效应,两者不是同一个步骤。后续页继续解释相关、检验阈值及错误结论的风险。

公式与条件

总体与抽样框一致,分层互斥完备,层内选择与非响应处理明确;比例分母为正,推断时写“估计”并保留不确定性。

p^=mn,M^=Np^
成立条件

n>0,样本中有m个符合条件;N为目标总体数量。抽样设计、覆盖范围及非响应处理须支持向该总体推广。第二式是估计数量,不是已经清点的实际数量。

从哪里来

样本内先算符合条件的占比m/n,再将同一比例用于目标总体得到估计数N×m/n。样本比例与真实总体比例可能不同,抽样误差及选择偏差不能由这个算式自动消除。

适用场景与常见误用

可以用在

  • 按调查样本估计人数或比例

  • 明确样本统计量与总体参数的区别

要防止

  • 便利样本不能只因样本大就推广

  • 估计人数可能不是整数,按用途说明取整且保留估计含义

知识讲解:抽样与统计估计

AI辅助推导复核:Codex,2026-09-09。

查看课程依据及核验范围

μ^=h=1HNhNx¯h,N=hNh
成立条件

分层互斥、覆盖目标总体,Nₕ>0,各层有合适的随机样本并得到层内均值x̄ₕ。权重用总体层占比,不能无条件用样本层占比。

从哪里来

总体均值等于各层总量相加后除以总人数,即ΣNₕμₕ/N。用各层的样本均值估计μₕ,得到加权估计。按比例分配样本且各层抽样合适时,样本占比与总体占比才一致。

适用场景与常见误用

可以用在

  • 样本分配不同比例时合并各层

  • 比较直接平均与总体加权

要防止

  • 不同层人数不等不能直接平均层均值

  • 层内样本偏差不会因加权自动消失

知识讲解:抽样与统计估计

AI辅助推导复核:Codex,2026-09-09。

查看课程依据及核验范围

x¯=w1x1++wnxnw1++wn
成立条件

wi0 且权重总和大于0;权重可表示频数或贡献比例。

取等条件

若所有正权重对应的x相同,均值等于该共同值;本式不是不等式。

从哪里来

每个值重复w次(整数频数)时,总和就是各值乘出现次数的和,再除总次数。比例权重使用同一分摊思想;权重总和为1时分母可省略。

适用场景与常见误用

可以用在

  • 按人数或频数合并均值

  • 计算明确比例的总评

要防止

  • 不同组人数不等时,组均值不能直接平均。

  • 权重总和不为1时不能省略分母。

知识讲解:数据的收集、整理与描述

AI辅助推导复核:Codex,2026-09-08。

查看课程依据及核验范围

s2=1ni=1n(xix¯)2
成立条件

n1;本页使用除以n的描述性方差。各数据须具有可比较的单位。

取等条件

方差为0当且仅当所有观测值相同。

从哪里来

离均差直接相加会抵消。平方后每项非负,平方离差的平均刻画围绕均值的分散程度;各值都相同时才为0。

适用场景与常见误用

可以用在

  • 在相同单位、相关背景下比较波动

  • 解释均值相同的数据仍可有不同分布

要防止

  • 不能把方差与均值混为一个指标。

  • 方差单位是原单位的平方;标准差才回到原单位。

知识讲解:数据的收集、整理与描述

AI辅助推导复核:Codex,2026-09-08。

查看课程依据及核验范围

组频率=组频数总频数=组距×频率密度
成立条件

分组互不重叠并覆盖全部数据;总频数为正,组距为正,纵轴明确为频率/组距。

从哪里来

每组占比先由频数除以总频数得到。令矩形面积等于占比,将其除以组距即为高度,所以全部矩形面积之和为1。

适用场景与常见误用

可以用在

  • 读取不同组距的直方图

  • 区分条形高度与频率面积

要防止

  • 组距不同时,高矩形的频率未必更大。

  • 必须先看纵轴是频数、频率还是频率密度。

知识讲解:数据的收集、整理与描述

AI辅助推导复核:Codex,2026-09-08。

查看课程依据及核验范围

典型例题

例 1(按比例分配样本)

学校1000人分为互斥两层,人数600与400。计划按比例分层随机抽50人,两层分别抽多少?

解与结论

(30,20)

  1. 第一层50×600/1000=30,第二层50×400/1000=20,共50。

    为什么这样做

    按总体占比配置样本,随后还要在每层内随机抽取。

易错与反例
  • 只规定人数没有完成随机抽样,还需说明怎么抽。

本例与题库共用题面、答案和解析。进入题组并选择独立练习或复测

例 2(按总体权重合并)

总体分甲乙两层,人数800、200;各层合适随机样本得到均值60、90。求总体均值的分层估计。

解与结论

66

  1. 总体权重分别0.8、0.2,所以估计0.8×60+0.2×90=66。

    为什么这样做

    总体均值按层的人数加权,不是按两个层的个数平均。

易错与反例
  • 直接(60+90)/2=75忽略了两层人数不同。

本例与题库共用题面、答案和解析。进入题组并选择独立练习或复测

例 3(选择偏差如何产生)

想估计全校学生每天运动时间,只在篮球社群发布自愿问卷。这个样本有什么问题?如何改进?

解与结论

覆盖与自愿应答可能造成选择偏差;应从全校名册随机抽样,并记录、处理未回应者。

  1. 篮球社群成员与愿意回复的人可能在运动习惯上不同于其他学生。先确定全校为目标总体,再采用覆盖全校的抽样框,必要时分年级抽样。

    为什么这样做

    样本应与要推断的总体对应,随机选择和跟进非响应是不同环节。

易错与反例
  • 增加同一社群的回复数量不能自动纠正覆盖不足。

本例与题库共用题面、答案和解析。进入题组并选择独立练习或复测

易错与反例

  • 每个人机会相同,不一定每个同容量样本都等可能。
  • 样本大不能自动消除偏差,分层也不能补救层内选择偏差。
  • 样本均值、总体估计与总体真实值要分清。

衔接提示

练习

10 道题。先独立作答,答案和解析默认收起。

第 1 题 基础 · 示例(讲解中已出现)

学校1000人分为互斥两层,人数600与400。计划按比例分层随机抽50人,两层分别抽多少?

查看答案

(30,20)

查看逐步解析与易错点
  1. 第一层50×600/1000=30,第二层50×400/1000=20,共50。

    为什么这样做

    按总体占比配置样本,随后还要在每层内随机抽取。

易错与反例

  • 只规定人数没有完成随机抽样,还需说明怎么抽。

本机记录

来源:自编。 断言已执行并通过,读取结构化答案。 AI辅助逐题复核:Codex,2026-09-09。

回补:抽样与统计估计。一道题出错只提供候选线索。

第 2 题 基础 · 示例(讲解中已出现)

总体分甲乙两层,人数800、200;各层合适随机样本得到均值60、90。求总体均值的分层估计。

查看答案

66

查看逐步解析与易错点
  1. 总体权重分别0.8、0.2,所以估计0.8×60+0.2×90=66。

    为什么这样做

    总体均值按层的人数加权,不是按两个层的个数平均。

易错与反例

  • 直接(60+90)/2=75忽略了两层人数不同。

本机记录

来源:自编。 断言已执行并通过,读取结构化答案。 AI辅助逐题复核:Codex,2026-09-09。

回补:抽样与统计估计。一道题出错只提供候选线索。

第 3 题 提高 · 示例(讲解中已出现)

想估计全校学生每天运动时间,只在篮球社群发布自愿问卷。这个样本有什么问题?如何改进?

查看答案

覆盖与自愿应答可能造成选择偏差;应从全校名册随机抽样,并记录、处理未回应者。

查看逐步解析与易错点
  1. 篮球社群成员与愿意回复的人可能在运动习惯上不同于其他学生。先确定全校为目标总体,再采用覆盖全校的抽样框,必要时分年级抽样。

    为什么这样做

    样本应与要推断的总体对应,随机选择和跟进非响应是不同环节。

易错与反例

  • 增加同一社群的回复数量不能自动纠正覆盖不足。

本机记录

来源:自编。 需推理复核;未自动验证展示答案。 AI辅助逐题复核:Codex,2026-09-09。

回补:抽样与统计估计。一道题出错只提供候选线索。

第 4 题 基础 · 独立练习

从1000人总体中合适随机抽40人,其中12人选择A。依次求样本比例及按此比例估计的总体选择A人数。

查看答案

(310,300)

查看逐步解析与易错点
  1. 样本比例12/40=0.3,估计总体人数1000×0.3=300。

    为什么这样做

    将样本比例用于总体是在做估计,真实人数未被逐一清点。

易错与反例

  • 300是估计值,不能写成已知全体恰有300人。

本机记录

来源:自编。 断言已执行并通过,读取结构化答案。 AI辅助逐题复核:Codex,2026-09-09。

回补:抽样与统计估计。一道题出错只提供候选线索。

第 5 题 基础 · 独立练习

两个互不重叠样本分别有10人、30人,样本均值72、80。合并这40人的样本均值是多少?

查看答案

78

查看逐步解析与易错点
  1. 合计数据总和为10×72+30×80=3120,除以40得78。

    为什么这样做

    这里求的是合并样本自身均值,权重用实际样本人数;与向总体分层估计的权重来源不同。

易错与反例

  • 不能直接平均72与80。

本机记录

来源:自编。 断言已执行并通过,读取结构化答案。 AI辅助逐题复核:Codex,2026-09-09。

回补:抽样与统计估计。一道题出错只提供候选线索。

第 6 题 提高 · 独立练习

总体为1、2、3、4四个编号,以各1/2的概率选样本{1,2}或{3,4}。每个人入样概率都相同,这就是容量2的简单随机抽样吗?

查看答案

不是;简单随机抽样要求6个不同二元子集均等可能,这个设计只有2个样本可能出现。

查看逐步解析与易错点
  1. 每个人入样概率确为1/2,但{1,3}等样本概率0。相同个人入样机会不能单独保证所有同容量样本等概率。

    为什么这样做

    简单随机抽样的定义约束整个样本的分布,而不只约束单个对象。

易错与反例

  • 不要把等概率入样与简单随机抽样完全等同。

本机记录

来源:自编。 需推理复核;未自动验证展示答案。 AI辅助逐题复核:Codex,2026-09-09。

回补:抽样与统计估计。一道题出错只提供候选线索。

第 7 题 提高 · 独立练习

900份网络自愿问卷一定比50份合适的随机样本更能代表目标总体吗?

查看答案

不能只凭数量判断。

查看逐步解析与易错点
  1. 自愿应答者可能与未应答者系统不同;较大数量能减小某些随机波动,却不能消除固定的覆盖、选择或测量偏差。需比较抽样框、应答机制和问题测量方式。

    为什么这样做

    样本量与抽样设计影响不同,不能用一个数量替代全部质量判断。

易错与反例

  • 小样本也不自动正确;它仍有不确定性,需要如实报告。

本机记录

来源:自编。 需推理复核;未自动验证展示答案。 AI辅助逐题复核:Codex,2026-09-09。

回补:抽样与统计估计。一道题出错只提供候选线索。

第 8 题 基础 · 独立练习

样本为2、4、6、8。本题用除以n的描述性方差,依次求均值和方差。

查看答案

(5,5)

查看逐步解析与易错点
  1. 均值20/4=5;方差[(2−5)²+(4−5)²+(6−5)²+(8−5)²]/4=20/4=5。

    为什么这样做

    本题描述这组数据的波动,分母已经约定为n=4。

易错与反例

  • 不能把本题分母换成n−1,也不能把样本方差等同已知的总体方差。

本机记录

来源:自编。 断言已执行并通过,读取结构化答案。 AI辅助逐题复核:Codex,2026-09-09。

回补:抽样与统计估计。一道题出错只提供候选线索。

第 9 题 基础 · 独立复测

两层总体人数为240、160,按比例随机抽取25人,依次求两层样本量。

查看答案

(15,10)

查看逐步解析与易错点
  1. 总人数400,抽样比25/400;两层分别240×25/400=15、160×25/400=10。

    为什么这样做

    分配结果要检查各层不超人数、总量等于计划量。

易错与反例

  • 不能按两层各抽一半忽略总体比例。

本机记录

来源:自编。 断言已执行并通过,读取结构化答案。 AI辅助逐题复核:Codex,2026-09-09。

回补:抽样与统计估计。一道题出错只提供候选线索。

第 10 题 基础 · 独立复测

甲乙层占总体3/4、1/4,层内随机样本均值分别12、20,求总体均值的分层估计。

查看答案

14

查看逐步解析与易错点
  1. 按总体权重合并,(3/4)×12+(1/4)×20=14。

    为什么这样做

    先核对权重和为1,再对层均值加权。

易错与反例

  • 总体权重不因某层问卷回收更多就自动改变。

本机记录

来源:自编。 断言已执行并通过,读取结构化答案。 AI辅助逐题复核:Codex,2026-09-09。

回补:抽样与统计估计。一道题出错只提供候选线索。

后继知识

依据

课程依据:高中:统计与推断。已定位原件主题,非全文逐字审定,核验范围与日期见引用中心。

教材版本与映射 · 纠错记录。具体学习安排须结合所用教材及已具备的能力。