跳到正文
格致开物MATHWIKI

简单随机抽样

简单随机不放回抽样(SRSWOR)从含 N 个不同单位的完整抽样框中选出 n 个,使每一种大小为 n 的单位组合都以相同概率出现。它比“随手挑几个学生”要求更强:抽中的机制应能重复说明,并保证不重复选取同一单位。

从六个数理解抽取

设一所学校六名学生的活动时长依次是 2、4、6、8、10、12 小时,目标是六人的均值 Y¯=7 小时。从编号 1—6 中不放回随机抽两人,任意一对的概率都是 1/(62)=1/15。若抽中时长 4 和 10,样本均值 y¯=(4+10)/2=7;抽到 2 和 4 时则只有 3。这次恰好等于总体均值不是方法的保证,保证是所有可能样本的平均等于 7。

实施时先冻结去重后的名单和 N,再用可靠随机数工具一次抽取 n 个不同编号,保留抽样代码、随机种子或抽取日志。若临时删去“不方便联系”的人,再从剩余名单补抽,就不再是原方案的简单随机样本。R 的 sample.int(N, n, replace = FALSE) 可执行这种编号抽取。

均值为何无偏

令 Ii 表示总体第 i 人是否入样,入样为 1,否则为 0。每人都出现在 (N−1n−1) 个可能样本中,故 E(Ii)=(N−1n−1)/(Nn)=n/N。把样本均值写成 y¯=n−1∑i=1NIiYi,取期望后逐项代入: E(y¯)=1n∑i=1NE(Ii)Yi=1nnN∑i=1NYi=Y¯. 这里的“无偏”只针对名单和记录值固定、反复按规定抽样的平均。若名单漏人或回答与时长相关,见调查中的覆盖与无回答误差。

抽样方差与有限总体修正

定义有限总体方差 S2=(N−1)−1∑i=1N(Yi−Y¯)2,抽样比例 f=n/N。两名不同单位同时入样的概率是 n(n−1)/[N(N−1)]。于是 Var⁡(Ii)=f(1−f),Cov⁡(Ii,Ij)=−f(1−f)/(N−1)。把 y¯−Y¯=n−1∑i(Ii−f)(Yi−Y¯) 平方取期望,并用 ∑i(Yi−Y¯)=0 消去交叉和,得到 Var⁡(y¯)=(1−nN)S2n. 括号是有限总体修正;当 n=N 时已看完所有人,抽样方差为零。未知的 S2 用样本方差 s2=(n−1)−1∑i∈s(Yi−y¯)2 代入,得到方差估计 V^(y¯)=(1−f)s2/n,要求 n≥2。

回到六人例子,总体 S2=14,故真正的设计方差是 (1−2/6)14/2=14/3。若只看到 4、10 两个数,算得 s2=18,本次方差估计为 (1−2/6)18/2=6。二者不同并非算错:用一个随机样本估计未知方差,本身也有波动。

规划样本量

若规划阶段估计标准差为 S,希望正态近似置信区间半宽不超过 E,先令 z(1−n/N)S2/n≤E,两边平方并整理得到 n≥z2S2E2+z2S2/N. 设 N=1200,S=3 小时、E=0.5 小时、z=1.96,上取整为 125。S 若来自小样本试调查,这只是规划值;特别小的 n 或偏态数据下,直接用 1.96 也未必给出准确覆盖率。具体执行前还要考虑分层、无回答和预算。

参考资料