社会调查报告
社会调查报告需要把“研究了谁、怎样得到数据、怎样算出结果”连在一起。一个均值与置信区间若没有总体、抽样框、完成数和权重,读者无法判断它可推广到哪里。报告应让结论的范围和证据处于同一页,而不是把方法藏在附件里。
一段可复查的结果
沿用分层随机抽样的虚构教学例子:目标总体是名单中某市 1,200 名高中生;按年级分为 600、400、200 人,分别简单随机抽取 60、40、20 人。假设全部完成、问卷按统一的七天活动定义实施,三层样本均值为 5、6、8 小时,样本标准差为 2、3、4 小时。则总体平均周时长估计为 5.833 小时,分层设计标准误估计为 0.240 小时。若采用正态近似,95% 区间约为 5.36—6.30 小时。
这段结论要连着条件读:区间是在相同名单和抽样机制下对抽样波动给出的近似范围;并未量化遗漏学生、记忆不准、问卷理解差异等误差。如果有人未回答,上述“全部完成”的计算便不适用。也不能把 95% 说成“这一批学生真实均值落在区间里的概率是 95%”;真实有限总体均值是固定的,95% 指同法重复抽样构造的区间约有 95% 能覆盖它。
| 年级 | 总体人数 | 抽中并完成 | 样本均值 | 样本标准差 |
|---|---|---|---|---|
| 一年级 | 600 | 60 | 5 | 2 |
| 二年级 | 400 | 40 | 6 | 3 |
| 三年级 | 200 | 20 | 8 | 4 |
| 按总体人数加权 | 1,200 | 120 | 5.833 | 分层标准误 0.240 |
方法页需要交代的细节
报告首页可先写研究问题、目标总体、时间地点、主要估计与适用范围;方法页应依次给出抽样框及覆盖范围、抽取程序和随机化单位、各层总体与样本数、问卷版本和调查模式、联络与回答状态、缺失值处理、权重构造、方差估计及区间方法。附上题目原文、变量字典和可公开的汇总代码,比只说“采用科学抽样”更有用。若资料涉及未成年人或可识别身份,应报告取得同意与数据保护安排,公开示例数据时使用合成或充分去标识的记录。
三种常见的越界解释
第一,把某校完成者结果写成“全市高中生情况”,跳过了名单与无回答。第二,把相关写成因果影响:即使年级内活动时长与成绩相关,也还可能存在共同原因。第三,只给整体均值而隐藏年级间差异;本例三个年级均值从 5 到 8 小时,整体 5.833 小时不能描述每个年级。差异是否可推广,还需对应的设计标准误与适当比较,不由均值大小单独决定。
一个好报告既要让普通读者看得懂“5.833 小时”指什么,也要让研究者能沿着调查方案设计、问卷设计和抽样公式重算它。调查后的发现如果改变了研究问题,应明确标作探索结果,不要写成事先设定的检验。