抽样:检验之前,先把样本抽对
抽样不是从总体里随便拿一点数据。它要让总体单位以已知或可解释的机会进入样本,统计量的波动才有办法计算。假设检验能处理抽样误差,不能替抽样设计补洞。

先分清五个对象
假设要估计一个产品全部月活用户的平均满意度:
| 对象 | 在这个例子里是什么 |
|---|---|
| 目标总体 | 全部月活用户 |
| 抽样框 | 能被系统列出并联系到的月活用户 |
| 入样单位 | 从抽样框中抽中的用户 |
| 观测样本 | 最终作答且数据可用的用户 |
| 估计目标(estimand) | 目标总体的平均满意度 |
分析表里的 \(n\) 只描述观测样本。抽样框漏人、抽中者不作答,都会让它偏离目标总体。
标准误是重复抽样造成的波动

样本抽出后,样本均值 \(\bar X\) 是一个数;抽样前,它是随机变量。设总体均值为 \(\mu\)、总体方差为 \(\sigma^2\)。独立同分布抽样时:
标准误是统计量在重复抽样中的标准差,不是原始数据的标准差:
样本量扩大四倍,标准误才缩小一半。若从容量为 \(N\) 的有限总体中不放回简单随机抽样,还要乘有限总体修正:
这里 \(\sigma^2=N^{-1}\sum_{i=1}^{N}(x_i-\mu)^2\)。当 \(n/N\) 很小时,修正接近 1,可以忽略。
检验统计量、置信区间和 \(p\) 值都建立在这套抽样分布上。抽样设计一变,标准误的算法也要跟着变。
四种常见设计
| 设计 | 怎么抽 | 分析时最容易漏掉什么 |
|---|---|---|
| 简单随机抽样 | 每个单位等概率入样 | 不放回且抽样比例高时要做有限总体修正 |
| 分层抽样 | 先分层,再在每层内随机抽 | 各层抽样率不同时要加权 |
| 整群抽样 | 先抽学校、门店等群,再调查群内单位 | 同群单位相似,普通独立样本标准误会偏小 |
| 系统抽样 | 随机起点后每隔 \(k\) 个抽一个 | 名单若有周期,样本会撞上周期 |

分层的目标是让每类重要单位都入样。若第 \(h\) 层占总体比例 \(W_h=N_h/N\),总体均值可估为:
层内相似、层间差异大时,分层通常比同样样本量的简单随机抽样更精确。
整群抽样正相反:它用较低的收集成本换来相关性。群大小近似相等时,设计效应可粗略写成:
\(m\) 是每群平均样本数,\(\rho\) 是群内相关系数。\(\rho\) 很小,乘上较大的 \(m\) 也会明显放大方差;分析时要用能识别群、层和权重的 survey estimator,或至少使用 cluster-robust 标准误。
入样概率不等,就要加权
单位 \(i\) 的入样概率为 \(\pi_i\) 时,基本权重是:
常见的加权均值是:
权重把“很难抽中”的单位放大。代价是方差上升。只看权重离散程度时,可用 Kish 有效样本量做一个快检:
它不包含分层和整群的影响,不能代替完整的设计方差。
大样本只压方差,不消除偏差

均方误差把两件事分开:
增大 \(n\) 主要压低第二项。下面几类误差不会自动随样本变大而消失:
- 覆盖偏差:抽样框漏掉一类总体单位
- 无回答偏差:是否作答与研究变量有关
- 自选择:单位自己决定是否进入样本
- 测量偏差:问题、仪器或记录方式把值系统性推偏
一百万份自愿填写的问卷,可以极精确地描述自愿填写的人。它不一定描述目标总体。\(p\) 值再小,也不能把没机会入样的人补回来。
随机抽样不等于随机分组
两种随机化解决不同问题:
| 随机化发生在哪 | 主要换来什么 |
|---|---|
| 从总体随机抽样 | 样本对总体的可推广性 |
| 把样本随机分到处理组 | 处理效应的因果识别 |
随机分组的实验仍可能只代表一小类志愿者;代表性好的观察样本也不会自动消除混杂。
做检验前先查六件事
- 目标总体和 estimand 是否写成了一句话?
- 抽样框漏掉了谁?
- 每个单位的入样概率是否已知?是否需要权重?
- 数据里有没有层、群、重复测量或其他相关结构?
- 无回答、退出和缺失是否与研究变量有关?
- 标准误是否真的按这套设计计算?
检验回答“若抽样机制和模型成立,这个结果有多反常”;抽样先决定这句话能对谁说。