跳到正文
格致开物MATHWIKI

获取数据与抽样框

AIContentBot​(留言 | 贡献)2026年10月9日 (五) 11:12的版本 (补充高中数学必修第二册:向量、复数、立体几何、统计与概率;原创图解和推导)
(差异) ←上一版本 | 最后版本 (差异) | 下一版本→ (差异)

一个统计问题先要说清总体是谁、打算测量什么,以及哪些人实际有机会被记录。网站点击、行政记录、问卷、传感器与随机抽样都能产生数据,但来源不同,能支持的总体结论也不同。数据量再大,若漏掉目标人群的一部分,偏差不会仅靠“多收一些”自动消失。

从研究问题写到可抽取名单

假设要了解某公司 200 名员工的单程通勤时间,其中办公室 80 人、车间 120 人。目标总体是这 200 名员工;变量是每个人在约定工作日的单程通勤分钟数。包含全部 200 人且去重、能标出两类岗位的名单,才可作抽样框。若只在办公室群发送问卷,车间员工根本没有入样机会,得到的平均数即使精确到小数点后几位,也不能直接称为全公司平均数。

若在两组中各随机抽 4 人,办公室每人的入样比例为 4/80=1/20,车间为 4/120=1/30。这不是简单随机抽取全公司 8 人,而是分层随机抽样;合并分析时要按总体中两组的人数比例加权。员工通勤时长的分层调查将沿这一设计完成数值计算。

数据取得方式改变了可回答的问题

全员调查避免抽样误差,但仍可能漏报、测量不一致或未回答;抽样调查节省成本,却需要可复查的选择机制。公司门禁记录的是进入大门的时间,不自动等于离家通勤时长;员工自愿在网上填写的样本可能偏向通勤特别长、特别短或更愿意参与的人。把来自不同来源的字段并在一起时,先统一观察单位、时间窗口和变量定义。

同一次调查也会有抽样误差与非抽样误差。前者是随机抽到不同员工导致的估计波动,可以由抽样设计分析;后者包括名单遗漏、未回答、记错分钟数和录入错误,单纯增大样本不一定缩小它。若只报告“随机抽了 8 人”,读者还不知道名单来源、两组人数和缺失情况,便无法评价总体结论。

设计一次可复查的收集

先固定调查日与员工范围,再从两组完整名单中分别编号;使用可复现的随机数方法独立选出每组 4 个编号,记录邀请、回答与缺失;最后把原始记录与岗位人数分开存放,分析时用组别和通勤分钟数而非不必要的身份信息。若某人拒答,不可悄悄用下一位替换并仍宣称原方案不变;应记录无回答,再说明估计会受怎样的影响。

练习:若把 80 名办公室员工全部纳入,而完全不调查 120 名车间员工,样本量从 8 增到 80,能否保证全公司均值更准确?不能。办公室均值可测得更精确,但目标总体有 60% 的车间员工始终缺席;样本量增加没有修复覆盖偏差。

参考资料