获取数据与抽样框
一个统计问题先要说清总体是谁、打算测量什么,以及哪些人实际有机会被记录。网站点击、行政记录、问卷、传感器与随机抽样都能产生数据,但来源不同,能支持的总体结论也不同。数据量再大,若漏掉目标人群的一部分,偏差不会仅靠“多收一些”自动消失。
从研究问题写到可抽取名单
假设要了解某公司 200 名员工的单程通勤时间,其中办公室 80 人、车间 120 人。目标总体是这 200 名员工;变量是每个人在约定工作日的单程通勤分钟数。包含全部 200 人且去重、能标出两类岗位的名单,才可作抽样框。若只在办公室群发送问卷,车间员工根本没有入样机会,得到的平均数即使精确到小数点后几位,也不能直接称为全公司平均数。
若在两组中各随机抽 4 人,办公室每人的入样比例为 ,车间为 。这不是简单随机抽取全公司 8 人,而是分层随机抽样;合并分析时要按总体中两组的人数比例加权。员工通勤时长的分层调查将沿这一设计完成数值计算。
数据取得方式改变了可回答的问题
全员调查避免抽样误差,但仍可能漏报、测量不一致或未回答;抽样调查节省成本,却需要可复查的选择机制。公司门禁记录的是进入大门的时间,不自动等于离家通勤时长;员工自愿在网上填写的样本可能偏向通勤特别长、特别短或更愿意参与的人。把来自不同来源的字段并在一起时,先统一观察单位、时间窗口和变量定义。
同一次调查也会有抽样误差与非抽样误差。前者是随机抽到不同员工导致的估计波动,可以由抽样设计分析;后者包括名单遗漏、未回答、记错分钟数和录入错误,单纯增大样本不一定缩小它。若只报告“随机抽了 8 人”,读者还不知道名单来源、两组人数和缺失情况,便无法评价总体结论。
设计一次可复查的收集
先固定调查日与员工范围,再从两组完整名单中分别编号;使用可复现的随机数方法独立选出每组 4 个编号,记录邀请、回答与缺失;最后把原始记录与岗位人数分开存放,分析时用组别和通勤分钟数而非不必要的身份信息。若某人拒答,不可悄悄用下一位替换并仍宣称原方案不变;应记录无回答,再说明估计会受怎样的影响。
练习:若把 80 名办公室员工全部纳入,而完全不调查 120 名车间员工,样本量从 8 增到 80,能否保证全公司均值更准确?不能。办公室均值可测得更精确,但目标总体有 60% 的车间员工始终缺席;样本量增加没有修复覆盖偏差。
参考资料
- OpenStax,Introductory Statistics 2e,§1.2:总体、样本及抽样偏差。
- 继续阅读:简单随机抽样、分层随机抽样、调查方案设计、员工通勤时长的分层调查。