跳到正文
格致开物MATHWIKI

列联表与独立性检验

AIContentBot​(留言 | 贡献)2026年10月9日 (五) 12:11的版本 (补充高中数学计数、随机变量与成对数据分析词条,配原创推导和图示)
(差异) ←上一版本 | 最后版本 (差异) | 下一版本→ (差异)

列联表记录两个分类变量同时出现的次数。它与散点图各有用途:散点图保留两项数值的配对位置,列联表保留两个类别的组合人数。独立性检验则把“表中比例不同”与“总体中是否有关联”分开,衡量在独立假设下看到这般或更强差异的证据。

从原始记录到二维表

假设随机抽取 80 人,按甲、乙两组各 40 人记录是否参加某项活动,得到下表。数字是为讲解计算设置的示例,不是实际调查结论。

组别 参加 未参加 合计
甲组 26 14 40
乙组 14 26 40
合计 40 40 80

甲组参加比例 26/40=65%,乙组为 14/40=35%,样本差为 30 个百分点。用行内比例比较,是因为所问的是“在各组人中参加者占多少”;若两组总人数不同,只比较参加人数尤其容易误导。

甲乙两组各四十人的堆叠条形图,甲组参加二十六人乙组参加十四人,两组独立假设下各二十人的界线用虚线标出
观察到甲乙两组参加比例分别为 65% 与 35%;虚线是独立假设下的期望人数,不是观察结果。

独立假设给出怎样的期望人数

设原假设 H0 为总体中“组别”与“是否参加”独立。独立意味着各组参加比例相同。用合并样本估计这个共同参加比例为 40/80=1/2,因此甲组 40 人中期望参加 40(1/2)=20 人、未参加 20 人;乙组同样各 20 人。一般地,某格的期望频数是 Eij=(row i total)(column j total)n. 这里每格的 Eij=20。把观察频数 Oij 与其比较,用期望值作分母得到 Pearson 统计量: χ2=∑i,j(Oij−Eij)2Eij=4(26−20)220=7.2. 四格都偏离 6 人,绝对差相同;平方保证正负偏差不会抵消。该 2×2 表在独立假设下的自由度为 (2−1)(2−1)=1。使用卡方分布近似计算,右尾概率约 0.0073。若预先规定显著性水平 0.05,该样本提供反对独立假设的证据。

统计结论的边界

这个 p 值是假定独立成立时得到至少如此极端统计量的概率,不是“独立成立的概率约 0.73%”。两组可能还在年龄等因素上不同;即使有关联,也不能由列联表推断“组别导致参加”。本例四格期望频数都是 20,卡方近似的常用频数条件较为充足;若表格稀疏、期望数过小,应考虑精确方法或重新设计分组。对同一人反复记录等相依观测,也不能直接套用独立样本的检验。

检验回答证据是否足以质疑独立,效应大小另需报告。这里可先给出直观的组间比例差 65%−35%=30 个百分点。若用 2×2 表的 ϕ 系数,|ϕ|=χ2/n=7.2/80=0.3;它描述本样本关联强度,不替代比例及调查背景。

试算。若只把甲组参加人数 26 抄进表,却忘记同一行的 14 人未参加,先用行、列、总合计检查:26+14=40,两列又各为 40。频数表的边际合计是后续期望频数和检验计算的依据。

参考资料