分层随机抽样
分层随机抽样先把总体分成互不重叠且合起来覆盖全体的层,再在每层内分别随机抽取。年级可以成为层:既能保证每个年级有样本,也允许活动时长的分散程度不同。分层是在抽人前做的;抽完以后才按年级整理表格,不能自动继承分层设计的方差公式。
三个年级的加权平均
以下均为虚构教学数据。全市高中生三个年级人数 分别是 600、400、200,总数 ;每层抽 人,完成者均值 小时,样本标准差 小时。令层权重 ,总体均值估计为 三个层均值的简单平均是 小时,它给每个年级相同权重,回答的是另一个问题。只有年级人数相同,二者才碰巧一致。
方差从各层相加
若各层内都是简单随机抽样,且不同层独立,,则 证明只需把 展开平方。层间抽取独立,交叉项的期望为零;每个平方项由层内简单随机抽样方差给出。用 代 得可计算的方差估计。本例每层抽样比例均为 0.1,三个方差贡献为 ,和是 平方小时,标准误约 小时。若完整回答、抽样设计照计划执行,正态近似 95% 区间约为 小时;它不包含名单遗漏或无回答偏差。
样本怎样分到各层
比例分配令 ,本例总样本 120 时得到 60、40、20。若各层调查成本相近、标准差 已有可靠预估,希望固定 下使方差较小,可以按 分配,称为 Neyman 分配。本例比例为 ,可取 45、45、30 人。
这个比例可从方差式推出来:其中 与 无关,故只需使 最小。柯西不等式给出 等号要求 与 成正比,即与 成正比。用上面的标准差作规划值,45、45、30 的估计方差约 ,比比例分配的 稍小。实际分配须取整数、保证每层样本足够,并考虑成本和抽样上限;若各层单人成本 不同,固定总成本下的最优比例改为 。