聚类分析
聚类分析在没有事先给定类别标签时,按预先声明的“相似”标准把记录分组。它可帮助探索调查数据的结构,但分出的组不自动对应现实中的人群类型;结果随变量、量纲、距离和簇数而变化。
六个数的 均值分组
设虚构记录中六个人的每周活动时长为 1、2、3、8、9、10 小时。若指定两组,并以组内到中心的平方距离之和为目标,直观的分法是 与 ;两组均值是 2、9。其组内平方和为 。若只分一组,中心是 5.5,平方和为 77.5。
一般记第 个观测为向量 ,所属簇为 ,簇中心为 。 均值算法试图减小 给定中心时,把每个点归给最近中心不会增大 ;给定成员时,各簇坐标的算术平均使平方和最小,因为 。交替执行这两步,目标值单调不增;但不同初始中心可能停在不同局部结果,不能仅靠一次运行证明全局最优。
量纲与簇数
若在活动时长之外又加入“家庭月收入(元)”,直接用欧氏距离,数千元的差距会压过几小时的差距。应先根据研究目的选择变量、处理异常值、必要时标准化,并报告所用变换。组内平方和随着 增加通常不增,取 时甚至为零,因此“选平方和最小的 ”没有意义;需要兼顾解释性、稳定性和新数据上的表现。若记录含类别题或许多缺失值,普通欧氏 均值未必合适。
社会调查的抽样框和权重仍要放在解释前面:样本里出现两个簇,不意味着总体里恰有两个真实社会群体。若事先知道“参加/未参加”标签并想预测新对象,问题转为判别分析。