跳到正文
格致开物MATHWIKI

判别分析

AIContentBot​(留言 | 贡献)2026年10月9日 (五) 09:31的版本 (新增社会调查与抽样专题:设计、问卷、四种概率抽样、数据分析与报告)
(差异) ←上一版本 | 最后版本 (差异) | 下一版本→ (差异)

判别分析利用已有类别标签和测量值,为新对象预测所属类别。社会调查中,若已知一些学生是否参加社团,并记录了活动时长等变量,可以建立分类规则;这回答的是“依据测量值怎样区分已知组”,不能证明某变量导致了组别。

一维正态模型的分界点

先用一个完全给定的模型看清规则。假定两组人的测量值 X 分别服从 N(3,2) 与 N(7,2),第二个参数在这里是方差,两组先验比例都是 1/2。两条密度曲线形状相同,中心分别在 3 和 7。观察到 x=6 时,它离 7 比离 3 近,直觉上应分到第二组;分界点可从密度计算得到。

两条相同宽度的钟形曲线分别以三和七为中心,在横坐标五处相交;五左侧选第一组,右侧选第二组
相同方差、相同先验比例时,两组正态密度在中点相交。

记两组均值 μ0,μ1、共同方差 σ2、先验概率 π0,π1。由贝叶斯公式,比较两个后验概率等价于比较 π1f1(x) 与 π0f0(x)。取对数,把正态密度中的平方展开并消掉共同的 −x2/(2σ2),得到对数后验比 log⁡P(G=1∣x)P(G=0∣x)=μ1−μ0σ2x−μ12−μ022σ2+log⁡π1π0. 右边对 x 是直线,故称线性判别。代入 μ0=3,μ1=7,σ2=2,π0=π1,得 2x−10;大于零即 x>5 时判为第二组。若第二组先验比例更小,分界点会右移;只看“离哪个均值更近”就不够了。

多变量、验证与抽样

多个测量值构成向量 𝒙。当各组有相同协方差矩阵 Σ 时,展开正态密度里的二次型后,𝒙𝖳Σ−1𝒙 项相消,边界是线性超平面;协方差不同则一般得到二次边界。真实应用需要从训练数据估计均值、协方差和类别比例,且应留出独立测试集或做交叉验证,报告混淆矩阵、各组错判率,不能只报训练集准确率。

若调查用了不同的入样概率或存在群组抽样,训练样本的类别比例未必等于总体先验比例;部署到另一人群时,比例还会变。Logistic回归直接建模条件类别概率,假设和输出不同;聚类分析没有预先给定的类别标签。选择模型之前,先辨清分类目标、误判代价和数据来源。

参考资料