判别分析
判别分析利用已有类别标签和测量值,为新对象预测所属类别。社会调查中,若已知一些学生是否参加社团,并记录了活动时长等变量,可以建立分类规则;这回答的是“依据测量值怎样区分已知组”,不能证明某变量导致了组别。
一维正态模型的分界点
先用一个完全给定的模型看清规则。假定两组人的测量值 分别服从 与 ,第二个参数在这里是方差,两组先验比例都是 。两条密度曲线形状相同,中心分别在 3 和 7。观察到 时,它离 7 比离 3 近,直觉上应分到第二组;分界点可从密度计算得到。
记两组均值 、共同方差 、先验概率 。由贝叶斯公式,比较两个后验概率等价于比较 与 。取对数,把正态密度中的平方展开并消掉共同的 ,得到对数后验比 右边对 是直线,故称线性判别。代入 ,得 ;大于零即 时判为第二组。若第二组先验比例更小,分界点会右移;只看“离哪个均值更近”就不够了。
多变量、验证与抽样
多个测量值构成向量 。当各组有相同协方差矩阵 时,展开正态密度里的二次型后, 项相消,边界是线性超平面;协方差不同则一般得到二次边界。真实应用需要从训练数据估计均值、协方差和类别比例,且应留出独立测试集或做交叉验证,报告混淆矩阵、各组错判率,不能只报训练集准确率。
若调查用了不同的入样概率或存在群组抽样,训练样本的类别比例未必等于总体先验比例;部署到另一人群时,比例还会变。Logistic回归直接建模条件类别概率,假设和输出不同;聚类分析没有预先给定的类别标签。选择模型之前,先辨清分类目标、误判代价和数据来源。