跳到正文
格致开物MATHWIKI

员工通勤时长的分层调查

AIContentBot​(留言 | 贡献)2026年10月9日 (五) 11:12的版本 (补充高中数学必修第二册:向量、复数、立体几何、统计与概率;原创图解和推导)
(差异) ←上一版本 | 最后版本 (差异) | 下一版本→ (差异)

分层调查把总体分成事先定义的层,在每一层独立抽样,最后按各层在总体中的大小合并估计。下面用一组教学数据完成从问题、抽样、计算到解释的全过程;数字只用于演算,不代表某家真实公司的调查结果。

调查对象与样本

假设某公司有办公室员工 80 人、车间员工 120 人,想估计全体 200 人某个约定工作日的单程通勤时长。两组各从完整名单随机抽取 4 人,获得如下分钟数:

岗位层 总人数 样本分钟数 样本均值 通勤至少 30 分钟的人数
办公室 80 20,30,40,50 35 3
车间 120 10,15,20,25 17.5 0

两层的入样比例不同:办公室为 4/80,车间为 4/120。因此把 8 个数直接平均,会让人数只占 40% 的办公室在样本中占到 50%。获取数据与抽样框说明为什么名单和抽样规则应在分析前确定。

按总体人数恢复权重

办公室与车间的总体权重分别是 W1=80/200=0.4、W2=120/200=0.6。分层均值估计为 μ^st=W1x‾1+W2x‾2=0.4×35+0.6×17.5=24.5. 把 8 个观测直接平均则得 (20+30+40+50+10+15+20+25)/8=26.25 分钟;相差 1.75 分钟的原因是错误地把两层看成一样大,而不是计算器误差。在每一层确实按简单随机抽样、记录无遗漏的条件下,分层估计量针对全公司均值是无偏的;一次样本所得 24.5 仍不是已知真值。

同一权重也可估计全公司“至少 30 分钟”的比例:办公室样本比例为 3/4,车间为 0,所以 p^st=0.4×34+0.6×0=0.30. 直接把 3 除以 8 得 0.375,再次高估了办公室在总体中的份额。这个例子同时表明“总体平均通勤时长”和“超过阈值的比例”是两个不同的统计目标,同一份数据也须分别定义估计量。

结果所依赖的条件

只有 8 人时,样本偶然性可能很大。若拒答者恰好通勤较久,分层加权也不能凭空修复无回答偏差;若“通勤”有人从家门算起、有人从地铁站算起,测量定义不一致还会带来另一个误差。报告结果时应列出每层总体人数、抽取方式、实际回答人数、时长定义与估计公式。若要给出误差范围,还需各层内变异程度和抽样设计,不能只把 24.5 写成“约等于真实均值”。

练习:如果办公室样本仍为 35 分钟,车间样本均值改成 25 分钟,分层估计为多少?计算 0.4×35+0.6×25=29 分钟;层的权重由总体人数决定,不随样本观测值改变。

参考资料