调查中的覆盖与无回答误差
抽样随机只保证在抽样框内、按规定回应的前提下可以计算抽样误差。若名单漏人、有人无法联系或拒答,估计量还会受到覆盖误差和无回答误差影响。另一个来源是题目理解与记录偏差,即测量误差;三者的生成机制不同。
名单与目标总体的差距
沿用虚构的高中生周活动时长调查。设目标总体 1,200 人,学籍名单因合并遗漏了 50 人。调查从剩余 1,150 人随机抽取 115 人,框内人人入样概率是 0.1,而遗漏者的概率是 0。若漏掉的学生恰好更常参加校外活动,即使框内全部回答,框内均值也可能与目标均值不同。给框内每名学生加大权重无法推出那 50 人的活动时长;第一步应检查并修补名单。
重复登记是相反问题:同一人有两条记录,就可能被抽中两次,实际入样概率升高。整理抽样框时应核对身份、在校状态和日期,但分析用表不必保留可识别身份的字段。
回答者与抽中样本的差距
再设名单完整,从 1,200 人中抽出 120 人,却只有 100 人交回问卷。完成率在这个简化例子里是 。若未回答的 20 人平均活动 2 小时,回答者平均 6 小时,则抽中 120 人的真实平均是 小时,直接把回答者均值 6 小时推广到抽中样本会高出 0.67 小时。这只是展示偏差机制的假想数值;实际未回答者的时长通常未知。
应保留每位抽中者的联络状态,并按公开的分类口径计算回应率;“无效号码”“明确拒答”“未接通”和“资格未知”不能随意合并。若已知全年级人数,可以按年级调整回答者权重,但这只有在同年级内回答倾向与活动时长的剩余差异足够小时才有帮助。增加回访、缩短问卷、提供适宜模式,往往比给最终样本套复杂权重更直接。
误差与样本量
抽样方差描述重复按同一概率设计抽样时估计值的波动;它不会包含上述遗漏或选择性无回答造成的固定偏差。一次调查的均方误差可以写为 。样本量变大通常降低第一项,却不保证第二项变小。因此报告均值和区间时要交代抽样框、完成情况与调整方式,不能只报一个很窄的置信区间。具体格式见社会调查报告。