描述数据及其不确定性

Lecture 6 从样本统计量到抽样分布

李勤

2026-10-11

学习重点

  • 如何描述一个样本?
  • 如何表达估计值的不确定性?
从观察样本、选择统计量、重复抽样到表达不确定性的流程

学习目标

完成本节课后,你应当能够:

  1. 根据变量类型和分布形状选择描述统计量;
  2. 区分总体、样本、参数、统计量和抽样单位;
  3. 用重复抽样解释抽样分布和标准误;
  4. 正确解释 95% 置信区间;
  5. 区分 SD、SE 和 CI,读懂图中的误差线。

案例思考:计算均值前的观察

假设两组植物的个体株高测量值如下:

组别 株高(cm)
A 18, 19, 20, 20, 21, 22, 40
B 16, 18, 20, 22, 24, 26, 28

哪一组的株高更高?哪一组数据的变异更大?你希望先看到什么图?

第一部分:描述一个样本

总体、样本、参数与统计量

总体 Population

  • 我们真正关心的全部研究对象
  • 总体特征称为参数
  • 例如总体均值 \(\mu\)、总体比例 \(p\)

样本 Sample

  • 实际被观察或测量的对象
  • 从样本算出的量称为统计量
  • 例如样本均值 \(\bar{x}\)、样本比例 \(\hat p\)

\[ \text{样本统计量}\quad \longrightarrow \quad \text{估计总体参数} \]

案例:松树的平均树龄

研究者在长白山随机设置 500 个 10 公顷样方(\(10^5 米^2\)),测量每个样方内所有松树的树龄。

方案 A

先计算每个样方内松树的平均树龄,再对 500 个样方取平均。

方案 B

把所有样方中的树合并,直接计算所有树的平均树龄。

两个方案估计的是同一个统计量吗?什么是该案例中的独立抽样单位?

(1 公顷 = 10,000 平方米)

先明确“要估计什么”

  • 样方等权:估计随机一个样方的平均树龄;
  • 所有树等权:估计随机一棵树的平均树龄;
  • 同一样方内的树共享小尺度的生境,通常不能视为完全独立的重复。

500 个样方是主要的抽样单位。把大量相关个体当成独立样本,会造成伪重复,夸大有效样本量。

描述统计量回答什么?

居中位置

  • 均值 mean
  • 中位数 median

离散程度

  • 标准差 SD
  • 四分位距 IQR

类别构成

  • 频数 count
  • 比例 proportion

描述数值变量时,通常要同时报告“中心”和“离散程度”。

样本均值:分布的“重心”

\[ \bar{x}=\frac{1}{n}\sum_{i=1}^{n}x_i \]

  • 使用了所有观测值;
  • 适合描述大致对称、没有强烈离群值的分布;
  • 容易受到极端值影响。

均值的单位与原始变量相同。

标准差:观测值离均值有多远

\[ s=\sqrt{\frac{\sum_{i=1}^{n}(x_i-\bar{x})^2}{n-1}} \]

  • SD 描述的是样本中个体之间的差异;
  • SD 越大,观测值通常离均值越远;
  • 对极端值敏感,最好与均值一起使用。

\(n-1\) 是对用样本均值代替未知总体均值所做的修正。

正态分布

  • 中心极限定理 the central limit theorem
  • 高尔顿版 Galton board
正态分布

正态分布中的经验规则

若数据的分布近似钟形:

  • 约 68% 的观测值位于 \(\bar{x}\pm 1 SD\)
  • 约 95% 的观测值位于 \(\bar{x}\pm 2 SD\)

这是对观测值分布的描述,不是均值的置信区间;偏斜分布也不能机械套用。

正态分布中的SD经验规则

中位数:排序后的中间位置

  • 将观测值从小到大排序;
  • 奇数个观测值:取正中间一个;
  • 偶数个观测值:取中间两个的均值;
  • 对极端值较稳健。
极端值会拉动均值,但较少影响中位数

四分位距:中间一半数据的跨度

\[ IQR=Q_3-Q_1 \]

  • \(Q_1\):第 25 百分位数;
  • \(Q_2\):中位数;
  • \(Q_3\):第 75 百分位数;
  • IQR 对极端值较稳健,通常与中位数一起报告。

均值 + SD,还是中位数 + IQR?

先看原始数据和分布图,再决定统计量;不要只根据样本量选择。

数据特征 推荐 理由
大致对称、无强烈离群值 均值 + SD 使用全部观测,解释直接
明显偏斜或有离群值 中位数 + IQR 对极端值更稳健
多峰或结构复杂 图形 + 多个摘要 单个中心可能会掩盖结构

变异系数

  • 什么是变异系数 Coefficient of variation (CV) ?
  • 什么场景需要应用变异系数?

分类变量:比例

若某类别记为 1,其他类别记为 0,则

\[ \hat p=\frac{\text{该类别的观测数}}{n} =\frac{1}{n}\sum_{i=1}^{n}x_i \]

  • 比例就是 0/1 变量的样本均值。
  • 因此比例也有抽样分布、标准误和置信区间。

课堂小测:该报告哪些统计量?

  1. 湖泊中鱼类体长数据,其频数分布近似对称,无明显离群值;
  2. 植物种子数的频数分布严重右偏,少数个体产生几千粒种子;
  3. 200 只鸟中感染寄生虫的个体数;
  4. 样本的频数分布出现两个明显峰值。

第二部分:估计的不确定性

抽样误差、偏差与精确度

用靶图区分偏差与精确度
  • 偏差 bias:估计结果系统性偏离真实参数;
  • 精确度 precision:重复抽样得到的估计值有多集中。

大样本能解决什么?

在随机、独立抽样等条件成立时:

  • 样本量增大,偶然抽样波动通常减小;
  • 估计值通常变得更精确。

大样本不能自动消除抽样设计、测量方法或选择过程造成的偏差。一个巨大的非随机样本,可能非常精确地给出错误答案。

思维实验:同一总体反复抽样

从同一总体反复抽样并形成样本均值的抽样分布

什么是抽样分布?

在抽样方法和样本量固定时,某个统计量在所有可能随机样本中形成的概率分布。

  • 样本原始数据分布:个体测量值的分布;
  • 抽样分布:(不同样本)统计量(例如 \(\bar X\))的分布;
  • (但)一项真实研究通常只得到其中一个样本、一个 \(\bar x\)。

容易混淆的三个分布

  • 总体分布
  • 样本分布
  • 抽样分布
分布 一个“数据点”是什么? 回答什么问题?
总体分布 一个个体 总体中的个体怎样变化?
样本分布 样本中的一个个体 当前样本长什么样?
均值的抽样分布 一个样本的均值 换一个样本,均值会怎样变化?

中心极限定理说了什么?

  • 在独立抽样、总体方差有限等条件下,样本量足够大时:

\[ \text{样本均值的抽样分布}\approx\text{正态分布} \]

  • 即使原始个体数据并不服从正态分布,这一近似也常常成立。

趋近正态的是样本均值的抽样分布,不是原始数据本身。

样本量如何改变抽样分布?

样本量增大时样本均值的抽样分布变窄
  • 抽样分布仍以总体均值 \(\mu\) 为中心;
  • \(n\) 增大,分布变窄;
  • 因而样本均值通常更接近 \(\mu\)。

游戏互动:先预测,再模拟

https://www.zoology.ubc.ca/~whitlock/Kingfisher/SamplingNormal.htm

保持总体分布不变,把每次抽样的样本量从 10 改为 100:

  1. 单个样本中的个体差异会消失吗?
  2. 样本均值的中心会移动吗?
  3. 样本均值的抽样分布会怎样变化?

第三部分:量化不确定性

标准误:抽样分布的标准差

  • 标准误(Standard Error, SE)衡量:
    • 如果重复进行同样的研究,估计值通常会波动多大。
  • 对于独立随机样本的均值:

\[ SE(\bar X)=\frac{\sigma}{\sqrt n} \qquad\text{实际中常估计为}\qquad \widehat{SE}(\bar X)=\frac{s}{\sqrt n} \]

为什么样本量要增加很多?

\[ SE=\frac{s}{\sqrt n} \]

样本量变化 SE 的变化
\(n\) 增为 4 倍 SE 约减为 \(1/2\)
\(n\) 增为 9 倍 SE 约减为 \(1/3\)
\(n\) 增为 100 倍 SE 约减为 \(1/10\)

要把标准误减半,样本量通常需要增加到 4 倍。

SD 和 SE 不是同一个量

标准差/SD 标准误/SE
描述对象 个体观测值 参数的估计值
主要含义 个体差异/数据变异 估计精确度/抽样波动
随 \(n\) 增加 不会必然趋近 0 通常按 \(1/\sqrt n\) 减小
常见用途 描述样本 推断总体参数

比例也有标准误

例如,100 株植物中有 40 株患病:

\[ \hat p=0.40 \]

换一批 100 株,\(\hat p\) 通常不会仍恰好等于 0.40。简单随机样本下:

\[ \widehat{SE}(\hat p)\approx \sqrt{\frac{\hat p(1-\hat p)}{n}} \]

比例接近 0 或 1、样本较小时,置信区间应采用更稳健的方法;以上公式主要用于简单推断。

95% 置信区间

  • 置信区间用一个范围表达参数估计的不确定性。常见的近似形式为:

\[ \text{estimate}\ \pm\ \text{临界值}\times SE \]

  • 对样本量较大的均值问题:

\[ 95\%\ CI\approx \bar x\pm 2SE \]

“2SE”是便于理解的近似。总体 SD 未知的小样本均值通常使用 \(t\) 临界值。

95% CI 的含义

重复抽样时大约百分之九十五的置信区间覆盖真实参数

如果用同样的方法反复抽样并构造置信区间,多次抽样后约 95% 的置信区间会覆盖真实参数。

哪个解释正确?

得到某次研究的 95% CI 为 \((28.3, 38.3)\):

A. 总体均值有 95% 的概率位于 28.3 到 38.3 之间。
B. 我们对该区间具有 95% 的置信度;所用方法在重复抽样中约有 95% 的区间覆盖真实均值。
C. 95% 的个体观测值位于 28.3 到 38.3 之间。
D. 下次实验的样本均值有 95% 的概率位于该区间。

CI 的宽度告诉我们什么?

  • 窄 CI:估计较精确;
  • 宽 CI:与数据相容的参数范围较宽,信息有限;
  • CI 宽度受样本量、数据变异和置信水平影响。

普通 95% CI 不会自动告诉我们区间内哪个参数值“更可能”,也不能证明区间外的值“不可能”。

  • 游戏互动
    • https://www.zoology.ubc.ca/~whitlock/Kingfisher/CIMean.htm

误差线必须有名字

图中的误差线可能表示:

  • 均值 \(\pm\) SD:展示个体差异;
  • 均值 \(\pm\) SE:展示估计精确度;
  • 95% CI:展示参数的不确定性范围。

图注必须写清误差线的含义和样本量。只写“error bars”是不够的。

推荐的展示方式

小样本

  • 显示所有原始数据点;
  • 叠加均值或中位数;
  • 如需推断,叠加 95% CI;
  • 标明每组 \(n\)。

避免

  • 只有柱形和不明误差线;
  • 用 SD 误差线替代原始数据分布;
  • 根据误差线是否重叠直接断言显著性;
  • 隐藏极端值或样本量。

第四部分:R Lab

从图形开始探索数据信息

library(tidyverse)

dat |> 
  ggplot(aes(x = treatment, y = response)) +
  geom_jitter(width = 0.12, alpha = 0.7) +
  geom_boxplot(width = 0.25, outlier.shape = NA) +
  theme_classic()

先检查分布形状、离群值、组间样本量和可能的数据录入问题。

计算描述统计量

  • mean(x, na.rm = T), median(),
  • var(), sd(), quantile(), IQR()
  • summary()
summary_dat <- dat |>
  group_by(treatment) |>
  summarise(
    n = sum(!is.na(response)),
    mean = mean(response, na.rm = TRUE),
    sd = sd(response, na.rm = TRUE),
    median = median(response, na.rm = TRUE),
    q1 = quantile(response, 0.25, na.rm = TRUE),
    q3 = quantile(response, 0.75, na.rm = TRUE),
    .groups = "drop"
  )

计算均值的 SE 和近似 95% CI

summary_dat <- summary_dat |>
  mutate(
    se = sd / sqrt(n),
    ci_low = mean - qt(0.975, df = n - 1) * se,
    ci_high = mean + qt(0.975, df = n - 1) * se
  )

这里使用 \(t\) 临界值。代码中的区间依赖独立、代表性抽样等假设;分组或层级数据可能需要其他方法。

画原始数据、均值和 95% CI

ggplot(dat, aes(treatment, response)) +
  geom_jitter(width = 0.12, alpha = 0.55) +
  geom_pointrange(
    data = summary_dat,
    aes(y = mean, ymin = ci_low, ymax = ci_high),
    colour = "firebrick", linewidth = 0.8
  ) +
  labs(x = NULL, y = "Response",
       caption = "红点为均值,误差线为 95% CI") +
  theme_classic()

总结与应用

概念链条

  • 描述统计量总结当前样本;
  • 抽样分布告诉我们换一个样本会发生什么;
  • SE 和 CI 则把估计的不确定性量化出来。
从描述样本到推断总体的概念链条

自我检查

离开课堂前,请用一句话分别回答:

  1. SD 与 SE 的区别是什么?
  2. 什么是样本均值的抽样分布?
  3. 为什么“95% 的个体位于均值的 95% CI 内”是错误的?
  4. 为什么把样本量扩大 4 倍,SE 通常只减半?

作业:读懂论文中的一幅图

选择本学院教师近五年论文中的一幅数据图,说明:

  1. 图中报告了什么变量和统计量?
  2. 抽样单位和样本量是什么?
  3. 误差线表示 SD、SE、CI,还是未说明?
  4. 统计量的具体生物学含义是什么?
  5. 根据该图可以得出什么结论,又不能得出什么结论?

提交内容:原图、完整图注、上述分析及参考文献。不要只写“这是均值”,要说明“什么变量的均值”。

合并上一次课件中的作业,一并提交。

参考资料

  • Whitlock, M. C. & Schluter, D. The Analysis of Biological Data, 3rd ed.

  • 原课程 R 练习与配套数据。

  • links

    • https://whitlockschluter3e.zoology.ubc.ca
    • https://bookdown.org/qiyuandong/_book/
    • https://www.math.pku.edu.cn/teachers/lidf/docs/Rbook/html/_Rbook/index.html
    • https://bookdown.org/hezhijian/book/