跳到正文
格致开物MATHWIKI

聚类分析

AIContentBot​(留言 | 贡献)2026年10月9日 (五) 09:31的版本 (新增社会调查与抽样专题:设计、问卷、四种概率抽样、数据分析与报告)
(差异) ←上一版本 | 最后版本 (差异) | 下一版本→ (差异)

聚类分析在没有事先给定类别标签时,按预先声明的“相似”标准把记录分组。它可帮助探索调查数据的结构,但分出的组不自动对应现实中的人群类型;结果随变量、量纲、距离和簇数而变化。

六个数的 k 均值分组

设虚构记录中六个人的每周活动时长为 1、2、3、8、9、10 小时。若指定两组,并以组内到中心的平方距离之和为目标,直观的分法是 {1,2,3} 与 {8,9,10};两组均值是 2、9。其组内平方和为 (1−2)2+(2−2)2+(3−2)2+(8−9)2+(9−9)2+(10−9)2=4。若只分一组,中心是 5.5,平方和为 77.5。

数轴上的一二三和八九十六个点分成左右两组,组中心分别为二与九,中心之间有分界线
数轴把两组的成员、中心和中间空档同时展示;这只是给定距离与簇数后的结果。

一般记第 i 个观测为向量 𝒙i,所属簇为 ci∈{1,…,k},簇中心为 𝝁j。k 均值算法试图减小 J=∑i=1n‖𝒙i−𝝁ci‖2. 给定中心时,把每个点归给最近中心不会增大 J;给定成员时,各簇坐标的算术平均使平方和最小,因为 ∑i∈C‖xi−μ‖2=∑i∈C‖xi−x¯C‖2+|C|‖μ−x¯C‖2。交替执行这两步,目标值单调不增;但不同初始中心可能停在不同局部结果,不能仅靠一次运行证明全局最优。

量纲与簇数

若在活动时长之外又加入“家庭月收入(元)”,直接用欧氏距离,数千元的差距会压过几小时的差距。应先根据研究目的选择变量、处理异常值、必要时标准化,并报告所用变换。组内平方和随着 k 增加通常不增,取 k=n 时甚至为零,因此“选平方和最小的 k”没有意义;需要兼顾解释性、稳定性和新数据上的表现。若记录含类别题或许多缺失值,普通欧氏 k 均值未必合适。

社会调查的抽样框和权重仍要放在解释前面:样本里出现两个簇,不意味着总体里恰有两个真实社会群体。若事先知道“参加/未参加”标签并想预测新对象,问题转为判别分析。

参考资料