Lecture 6 从样本统计量到抽样分布
2026-10-11
完成本节课后,你应当能够:
假设两组植物的个体株高测量值如下:
| 组别 | 株高(cm) |
|---|---|
| A | 18, 19, 20, 20, 21, 22, 40 |
| B | 16, 18, 20, 22, 24, 26, 28 |
哪一组的株高更高?哪一组数据的变异更大?你希望先看到什么图?
\[ \text{样本统计量}\quad \longrightarrow \quad \text{估计总体参数} \]
研究者在长白山随机设置 500 个 10 公顷样方(\(10^5 米^2\)),测量每个样方内所有松树的树龄。
先计算每个样方内松树的平均树龄,再对 500 个样方取平均。
把所有样方中的树合并,直接计算所有树的平均树龄。
两个方案估计的是同一个统计量吗?什么是该案例中的独立抽样单位?
(1 公顷 = 10,000 平方米)
500 个样方是主要的抽样单位。把大量相关个体当成独立样本,会造成伪重复,夸大有效样本量。
描述数值变量时,通常要同时报告“中心”和“离散程度”。
\[ \bar{x}=\frac{1}{n}\sum_{i=1}^{n}x_i \]
均值的单位与原始变量相同。
\[ s=\sqrt{\frac{\sum_{i=1}^{n}(x_i-\bar{x})^2}{n-1}} \]
\(n-1\) 是对用样本均值代替未知总体均值所做的修正。
若数据的分布近似钟形:
这是对观测值分布的描述,不是均值的置信区间;偏斜分布也不能机械套用。
\[ IQR=Q_3-Q_1 \]
先看原始数据和分布图,再决定统计量;不要只根据样本量选择。
| 数据特征 | 推荐 | 理由 |
|---|---|---|
| 大致对称、无强烈离群值 | 均值 + SD | 使用全部观测,解释直接 |
| 明显偏斜或有离群值 | 中位数 + IQR | 对极端值更稳健 |
| 多峰或结构复杂 | 图形 + 多个摘要 | 单个中心可能会掩盖结构 |
若某类别记为 1,其他类别记为 0,则
\[ \hat p=\frac{\text{该类别的观测数}}{n} =\frac{1}{n}\sum_{i=1}^{n}x_i \]
在随机、独立抽样等条件成立时:
大样本不能自动消除抽样设计、测量方法或选择过程造成的偏差。一个巨大的非随机样本,可能非常精确地给出错误答案。
在抽样方法和样本量固定时,某个统计量在所有可能随机样本中形成的概率分布。
| 分布 | 一个“数据点”是什么? | 回答什么问题? |
|---|---|---|
| 总体分布 | 一个个体 | 总体中的个体怎样变化? |
| 样本分布 | 样本中的一个个体 | 当前样本长什么样? |
| 均值的抽样分布 | 一个样本的均值 | 换一个样本,均值会怎样变化? |
\[ \text{样本均值的抽样分布}\approx\text{正态分布} \]
趋近正态的是样本均值的抽样分布,不是原始数据本身。
https://www.zoology.ubc.ca/~whitlock/Kingfisher/SamplingNormal.htm
保持总体分布不变,把每次抽样的样本量从 10 改为 100:
\[ SE(\bar X)=\frac{\sigma}{\sqrt n} \qquad\text{实际中常估计为}\qquad \widehat{SE}(\bar X)=\frac{s}{\sqrt n} \]
\[ SE=\frac{s}{\sqrt n} \]
| 样本量变化 | SE 的变化 |
|---|---|
| \(n\) 增为 4 倍 | SE 约减为 \(1/2\) |
| \(n\) 增为 9 倍 | SE 约减为 \(1/3\) |
| \(n\) 增为 100 倍 | SE 约减为 \(1/10\) |
要把标准误减半,样本量通常需要增加到 4 倍。
| 标准差/SD | 标准误/SE | |
|---|---|---|
| 描述对象 | 个体观测值 | 参数的估计值 |
| 主要含义 | 个体差异/数据变异 | 估计精确度/抽样波动 |
| 随 \(n\) 增加 | 不会必然趋近 0 | 通常按 \(1/\sqrt n\) 减小 |
| 常见用途 | 描述样本 | 推断总体参数 |
例如,100 株植物中有 40 株患病:
\[ \hat p=0.40 \]
换一批 100 株,\(\hat p\) 通常不会仍恰好等于 0.40。简单随机样本下:
\[ \widehat{SE}(\hat p)\approx \sqrt{\frac{\hat p(1-\hat p)}{n}} \]
比例接近 0 或 1、样本较小时,置信区间应采用更稳健的方法;以上公式主要用于简单推断。
\[ \text{estimate}\ \pm\ \text{临界值}\times SE \]
\[ 95\%\ CI\approx \bar x\pm 2SE \]
“2SE”是便于理解的近似。总体 SD 未知的小样本均值通常使用 \(t\) 临界值。
如果用同样的方法反复抽样并构造置信区间,多次抽样后约 95% 的置信区间会覆盖真实参数。
得到某次研究的 95% CI 为 \((28.3, 38.3)\):
A. 总体均值有 95% 的概率位于 28.3 到 38.3 之间。
B. 我们对该区间具有 95% 的置信度;所用方法在重复抽样中约有 95% 的区间覆盖真实均值。
C. 95% 的个体观测值位于 28.3 到 38.3 之间。
D. 下次实验的样本均值有 95% 的概率位于该区间。
普通 95% CI 不会自动告诉我们区间内哪个参数值“更可能”,也不能证明区间外的值“不可能”。
图中的误差线可能表示:
图注必须写清误差线的含义和样本量。只写“error bars”是不够的。
先检查分布形状、离群值、组间样本量和可能的数据录入问题。
mean(x, na.rm = T), median(),var(), sd(), quantile(), IQR()summary()summary_dat <- dat |>
group_by(treatment) |>
summarise(
n = sum(!is.na(response)),
mean = mean(response, na.rm = TRUE),
sd = sd(response, na.rm = TRUE),
median = median(response, na.rm = TRUE),
q1 = quantile(response, 0.25, na.rm = TRUE),
q3 = quantile(response, 0.75, na.rm = TRUE),
.groups = "drop"
)这里使用 \(t\) 临界值。代码中的区间依赖独立、代表性抽样等假设;分组或层级数据可能需要其他方法。
离开课堂前,请用一句话分别回答:
选择本学院教师近五年论文中的一幅数据图,说明:
提交内容:原图、完整图注、上述分析及参考文献。不要只写“这是均值”,要说明“什么变量的均值”。
合并上一次课件中的作业,一并提交。
Whitlock, M. C. & Schluter, D. The Analysis of Biological Data, 3rd ed.
原课程 R 练习与配套数据。
links