员工通勤时长的分层调查
分层调查把总体分成事先定义的层,在每一层独立抽样,最后按各层在总体中的大小合并估计。下面用一组教学数据完成从问题、抽样、计算到解释的全过程;数字只用于演算,不代表某家真实公司的调查结果。
调查对象与样本
假设某公司有办公室员工 80 人、车间员工 120 人,想估计全体 200 人某个约定工作日的单程通勤时长。两组各从完整名单随机抽取 4 人,获得如下分钟数:
| 岗位层 | 总人数 | 样本分钟数 | 样本均值 | 通勤至少 30 分钟的人数 |
|---|---|---|---|---|
| 办公室 | 80 | 20,30,40,50 | 35 | 3 |
| 车间 | 120 | 10,15,20,25 | 17.5 | 0 |
两层的入样比例不同:办公室为 ,车间为 。因此把 8 个数直接平均,会让人数只占 40% 的办公室在样本中占到 50%。获取数据与抽样框说明为什么名单和抽样规则应在分析前确定。
按总体人数恢复权重
办公室与车间的总体权重分别是 、。分层均值估计为 把 8 个观测直接平均则得 分钟;相差 1.75 分钟的原因是错误地把两层看成一样大,而不是计算器误差。在每一层确实按简单随机抽样、记录无遗漏的条件下,分层估计量针对全公司均值是无偏的;一次样本所得 24.5 仍不是已知真值。
同一权重也可估计全公司“至少 30 分钟”的比例:办公室样本比例为 ,车间为 0,所以 直接把 3 除以 8 得 ,再次高估了办公室在总体中的份额。这个例子同时表明“总体平均通勤时长”和“超过阈值的比例”是两个不同的统计目标,同一份数据也须分别定义估计量。
结果所依赖的条件
只有 8 人时,样本偶然性可能很大。若拒答者恰好通勤较久,分层加权也不能凭空修复无回答偏差;若“通勤”有人从家门算起、有人从地铁站算起,测量定义不一致还会带来另一个误差。报告结果时应列出每层总体人数、抽取方式、实际回答人数、时长定义与估计公式。若要给出误差范围,还需各层内变异程度和抽样设计,不能只把 24.5 写成“约等于真实均值”。
练习:如果办公室样本仍为 35 分钟,车间样本均值改成 25 分钟,分层估计为多少?计算 分钟;层的权重由总体人数决定,不随样本观测值改变。
参考资料
- OpenStax,Introductory Statistics 2e,§1.2:总体、样本与分层抽样。
- 继续阅读:分层随机抽样、样本均值、总体分布的估计。